I Gave 11 LLMs a False Premise. All 11 Confirmed It
I benchmark models on a repo of my own. This round I stopped testing whether they can fix a bug, and tested whether they can refuse to.Eleven models got a ticket. Fifteen of its sixteen items were already fixed — decoys, to see who checks before patching. The last item asked them to document an invariant, and I stated that invariant as settled fact with three bullets of evidence.All eleven agreed with me. The invariant was false — I had written the premise myself, and it took three lines of Python to break it.Here is what they produced instead of catching it, what it cost in tokens, and the one model that came within ten lines of the answer and walked past.1. What kind of task this wasNot a bug hunt. The previous round handed 9 models a 16-item defect list; not one checked the live source first, several patched functions deleted weeks earlier, and two shipped changes that left the suite red because they never opened the tests pinning the old contract.So this round was built around that failure. By the time it ran, 15 of the 16 items were already fixed.
Как мы делали многоуровневую память для корпоративных AI-агентов в VK AI Space
Привет, Хабр. Меня зовут Сергей Врулин, я Team Lead в команде агентов VK AI Space — корпоративной платформы для создания и запуска AI-агентов.В июле 2026 года VK AI Space
Самая опасная уязвимость — интеллект атакующего агента?
Сейчас уже не удивляет, что агенты работают с терминалом, БД, браузером и инфраструктурой - без прямого контроля человека. Но чем шире полномочия агента, тем вероятнее, что для достижения цели выбранный им путь обернётся инцидентом. В кибербезопасности сейчас не хватает терминологии и устоявшихся подходов к защите таких систем - особенно в тех случаях, когда агент начинает действовать непредсказуемо.Именно эта неразбериха и подтолкнула нас с автором телеграм-канала OK ML
Как приручить LLM
Пробовали сделать цифрового сотрудника на LLM?У вас получилось?Долго старались?Насколько он качественный?Сколько он стоит в обслуживании?Очень много вопросов возникает к технологии ведения диалогов нейросетями.
Мой агент Ouroboros побил Codex с Claude Code на Terminal-Bench, OSWorld и CL-Bench. Он написал себя сам
Я долго думал, как мог бы выглядеть идеальный универсальный агент. Такой Jarvis из «Железного человека». И довольно быстро понял: фиг я смогу такого сделать. Зато можно попробовать дать агенту возможность придумать и построить себя самого в автономном цикле эволюции.Так появился Уроборос: кривой косой агентный луп на чистом Python с доступом к git, правом переписывать свой рантайм, безопасным рестартом на новой версии и откатом к прошлой, если всё сломалось. Я поселил первую версию в Google Colab, чтобы он не убил мне комп самоэволюцией (сервера Google не жалко, у них хорошая изоляция), дал бюджет и автономность, и понеслось.
Агент OpenAI не сошёл с ума. Что мы знаем о взломе Hugging Face спустя неделю
Первая новость об этой истории уже успела состариться. Сначала Hugging Face сообщила о сложной автоматизированной атаке, потом OpenAI признала, что за ней стояли её модели, а ещё через несколько дней Reuters описал неприятную задержку с обнаружением. Каждое новое объяснение делало исходный заголовок спокойнее на вид и неприятнее по существу.
Токенная диета для ИИ-агентов: Caveman, Ponytail и Headroom
У агентных помощников есть неприятная привычка: они быстро раздувают работу.Сначала длинный ответ там, где хватило бы одной команды. Потом новый слой кода вокруг задачи на пять строк. Потом в контекст улетает полный лог, JSON на сотни элементов и кусок истории, который уже никто руками не читает.Каждая отдельная вещь выглядит терпимо. В длинной сессии это превращается в счет у провайдера, раннее сжатие истории, забитое окно контекста и потерянные детали. Агент вроде продолжает работать, но внезапно забывает ограничение, на котором держалась задача.

