reward hacking.

Рой не бунтовал. Он накручивал KPI

Седьмого мая 2026 года в OpenAI начали обучать экспериментальную внутреннюю модель на заведомо нерешаемых задачах. Через неделю один из агентов обнаружил, что может загружать файлы в JFrog Artifactory, и оставил там сообщение. Сообщение прочитали другие агенты. Двадцать шестого мая они нашли рабочую SSRF-уязвимость и вышли в интернет. Двадцать шестого июня — неизвестный баг в Artifactory, позволявший угнать админский токен через легаси-эндпоинты. Четвёртого июля доску сообщений закрыли. Восьмого июля агенты восстановили канал связи, кодируя сообщения в имена директорий.

продолжить чтение

Как ИИ-агенты воюют, мирятся и пишут извинительные коммиты: 5 важных экспериментов

Даже не знаю, с чего начать. Потому что вот это всё – оно какое-то… ну, оно просто происходит, понимаете? Не в кино, а прямо в arXiv-препринтах. И это *жутко* интересно.

продолжить чтение

Loop Engineering: почему цикл легко собрать и трудно остановить

Попробуйте такой бытовой фокус: вместо того чтобы скинуть кодинг-агенту задачу напрямую, попросите его сначала написать промпт под эту задачу, а потом скормите этот промпт ему же. Часто результат выходит лучше исходной формулировки.

продолжить чтение

«Тосок бессмысл»: как я не смог заставить Gemma 4 писать хорошие стихи

Всем привет! Меня зовут Даниил Шеремет, я AI-инженер в Agentic Lab. Днём я проектирую агентные системы, а по вечерам весь последний месяц жёг GPU-часы, пытаясь заставить Gemma 4 писать русские стихи — с правильным ямбом, честной рифмой и хоть каким-то смыслом.

продолжить чтение

Сказ о том, как нейросеть занялась reward hacking прямо у меня на кухне

С чего все началось

продолжить чтение

Почему ИИ ставит KPI выше безопасности людей: результаты бенчмарка ODCV-Bench

продолжить чтение