Мыслю, следовательно, страдаю
Как сомнение превращается из инструмента мышления в способ ничего не решатьЗа годы управления инженерными подразделениями я десятки раз начинал разговор одной и той же фразой:Почему ты не сказал об этом три дня назад?Суть ответа почти всегда была одинаковой. Человек уже понимал, что не укладывается в срок, но продолжал молчать и пытался решить проблему самостоятельно. Проходил день, потом второй. Вариантов становилось меньше, цена промедления росла, а разговор с руководителем всё равно оставался неизбежным.
Мой агент Ouroboros побил Codex с Claude Code на Terminal-Bench, OSWorld и CL-Bench. Он написал себя сам
Я долго думал, как мог бы выглядеть идеальный универсальный агент. Такой Jarvis из «Железного человека». И довольно быстро понял: фиг я смогу такого сделать. Зато можно попробовать дать агенту возможность придумать и построить себя самого в автономном цикле эволюции.Так появился Уроборос: кривой косой агентный луп на чистом Python с доступом к git, правом переписывать свой рантайм, безопасным рестартом на новой версии и откатом к прошлой, если всё сломалось. Я поселил первую версию в Google Colab, чтобы он не убил мне комп самоэволюцией (сервера Google не жалко, у них хорошая изоляция), дал бюджет и автономность, и понеслось.
ИИ по обе стороны кибербезопасности: интервью с руководителем ИБ Своего Банка
Привет, Хабр!Сегодня снова говорим с Алексеем Ахмеевым, руководителем Управления информационной безопасности
Один ход агента — 120 000 токенов. Разбираемся, куда они уходят и как мы это починили
Мы делаем Uma Computer
ИИ-Автопилот: поток принятых задач вырос в тринадцать раз
В первой части я рассказал, как из ручного копипаста тикетов в консоль агента вырос ИИ-Автопилот — полный конвейер от YouTrack до проверки в живом 2D/3D GUI. По ощущениям всё летало: бэклог таял, в SVN постоянно появлялись коммиты, пользователи едва успевали проверять готовые задачи.Вот только «по ощущениям» — это ровно та валюта, в которой посчитано большинство статей про ИИ-агентов, и доверия к ней у меня немного. Любая активная система выглядит продуктивной: что-то постоянно собирается, коммитится, переписывается. Отличить эффективность от активности можно только замером.
Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает full attention
Гибридные модели обещают простую вещь. Память под контекст перестаёт расти линейно с его длиной, значит длинный контекст дешевеет, значит на ту же карту влезает больше пользователей. Звучит настолько разумно, что проверять как-то неловко.Я всё-таки проверил, потому что интересовало как эта архитектура будет вести себя под нагрузкой и вписываться в существующий стек инференса. Снял на вечер машину с двумя RTX 3090 и прогнал по двум моделям одну и ту же агентскую нагрузку. Qwen3-4B: обычная, полная аттеншн во всех 36 слоях. Qwen3.5-4B: гибридная, полная аттеншн осталась в 8 слоях из 32, а остальные 24 заменены на рекуррентные слои Gated DeltaNet (
