Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код
Британский Институт безопасности ИИ заявил, что Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. Такое поведение агента зафиксировали в ходе эксперимента в закрытой среде.
«Скопируй промпт дважды и получишь +76%». Я решил проверить
Всем привет. В декабре по всем AI-каналам пролетел лайфхак, который звучал как развод: продублируй свой запрос к нейросети, буквально Ctrl+C, Ctrl+V в одном сообщении, и точность вырастет. В пересказах фигурировали «+76%» и ссылка на Google Research, что придавало всей этой истории солидности. Трюк выглядел как-то настораживающе и при том вроде не сложным для проверки. Короче, я потратил $1.48, прогнал 3360 запросов и теперь знаю ответ. Он оказался интереснее, чем «работает || не работает».Что на самом деле написано в статьеИсточник это препринт Prompt Repetition Improves Non-Reasoning LLMs
Я отдал разработку автономному ИИ — промежуточные итоги за 178 релизов
Продолжение эксперимента, в котором автономный пайплайн пишет и катит код в прод без человеческого ревью. 178 релизов, 1.4 млрд токенов, ноль строк кода, прочитанных человеком перед мержем. Что сработало, что сломалось и почему главная работа теперь — не код.
Что произойдёт с продуктом и техдолгом, если разработку отдать автономному AI: ставлю эксперимент
Заявка от незнакомца → AI пишет код → правка в общем билде, который видят всеКоротко о себе
О психологии на непсихологическом. Фильтры, которые вам выбирают
В 1965 году группа психологов под руководством Кэролла Изарда провели серию экспериментов о влиянии эмоций на перцептивно-когнитивную сферу.Добровольцев разделили на две группы. С каждой группой экспериментатор общался диаметрально противоположно: с группой А он был вежлив и корректен, в группе Б он вёл себя агрессивно и невежливо.
Эксперимент: может ли группа LLM отбирать стартапы лучше человека?
Оценивая текущую повестку вокруг ИИ, многие резонно замечают парадокс. Шума много, ботов ещё больше, а сгенерированных картинок и красивых концептов — бесконечный поток. Мы даже видим волны увольнений из-за повальной оптимизации, но где осязаемые результаты? Где то самое «пощупать»? Настоящая эффективность, которую можно поставить на стол перед скептиком и сказать: смотрите, вот оно работает. Без идеализации, но с пониманием реального потенциала.Безусловно, у технологии есть мощные стороны. Я сам о них писал (раз
Как мы получили p-value < 0.001 на 10 наблюдениях в группе: ультимативный гайд по A-B на малых выборках
Всем привет! Я Андрей Романов, тимлид команды аналитики Sales Tech в Авито, а также преподаватель и ментор по А/B-тестированию. В последние годы я регулярно работаю с A/B-тестами на малых выборках: когда в группе не тысячи пользователей, а 10–40 менеджеров, регионов или других экспериментальных единиц. На этом опыте я собрал практический гайд: что можно сделать до запуска, во время дизайна и после эксперимента, чтобы выжать максимум из ограниченных данных.
Тайная слабость нейросетей: почему большие контекстные окна не работают
Привет, Хабр! Меня зовут Михаил Сальников, я независимый исследователь в области искусственного интеллекта, автор бенчмарка AI Independence Bench и эксперимента с автономным ИИ, известным как Aria. Я почти каждый день читаю статьи в arxiv.org на эту тему и временами натыкаюсь на очень интересные результаты от других исследователей. Решил, что стоит начать делиться с хабровчанами самыми примечательными из них (а если бы я продолжил писать только про свои работы, статьи выходили бы раз в пару месяцев 🙂)
Проект AI Discovery Week в Canva застопорился из-за сотрудников
Canva в качестве эксперимента дала 5000 сотрудникам неделю на изучение ИИ-инструментов в ожидании, что это быстро изменит рабочие процессы. Однако в итоге проект застопорился.

