кодинг-агенты.

Устав и летопись кодинг-агентов

При ИИ-ассистированной разработке (или, если угодно, вайб-кодинге) довольно быстро проявляются одни и те же проблемы:деградация контекста (модель “забывает” детали);саботаж команд или неаккуратное следование;трудности переноса контекста (в новую сессию или агента);ограничение контекстного окна и суммаризации (контекст ограничен возможностями модели, а контроль за суммаризацией, как один из способов решения проблемы, затруднителен);малая наглядность и проверяемость процесса разработки.

продолжить чтение

Harness кодинг‑агента: разобрал исходники Codex, OpenCode, Pi и свою собственную

В прошлой статье про промпт-кэш я сформулировал вещь, которая на самом деле важнее самого кэша: модель ничего не помнит, она stateless

продолжить чтение

Как мы внедряли ИИ на 500 инженеров, а скорость не росла. Часть 2. Почему AI-first команды не делают нас быстрее

В первой части статьи мы пришли к выводу, что само использование ИИ не ускоряет инженерную систему. Можно вырастить использование LLM-инструментов в принципе (MAU LLM), потом использование кодинг-агентов (MAU API) и всё равно не увидеть изменений в Lead Time, Throughput и Defect Rate.Проблема в том, что локальное ускорение быстро упирается в остальной процесс. Один человек или одна роль могут начать делать свою часть быстрее, но задача всё равно ждёт требований, проверки, тестирования, согласований, соседних команд или бизнес-эксперта. Поэтому дальше мы пошли в Agentic Engineering.

продолжить чтение

Как мы внедряли ИИ на 500 инженеров, а скорость не росла. Часть 1. Рост использования не равен ускорению разработки

ИИ в разработке сейчас внедряют почти все. Кто-то подключает чат, кто-то раздаёт доступ к кодинг-агентам, а кто-то обучает свои модели. На графиках пользователи и активность растут, инженеры пробуют инструменты и привыкают к новой реальности, но при проверке метрик очень часто выясняется, что работать ничего быстрее не стало.

продолжить чтение

AI предлагает, мержу я: почему я не даю агенту последний ход

Есть неприятная иллюзия: если модель стала сильнее, ей можно дать больше свободы. В кодинге это быстро выходит боком. Агент пишет много, уверенно, иногда даже красиво. Потом ты открываешь diff и понимаешь, что вместе с полезным кодом туда попало… ну, назовём это решениями, которые ты сам никогда бы не принял.У меня после нескольких таких заходов появилась простая граница.AI может предлагать. Мержу я.

продолжить чтение

Пишем кодинг‑агента на Swift с нуля: неочевидные сложности очевидной идеи

Я долго пользовался разными кодинг‑агентами, и на их фоне Claude Code для меня заметно выделялся: качеством решений, удобством работы и вниманием к деталям. В какой‑то момент мне захотелось не просто пользоваться таким инструментом, а понять, что на самом деле происходит у него под капотом. Так я сел писать собственного агента на Swift, с нуля, без использования готовых решений.

продолжить чтение

Новый бенчмарк по кодингу для LLM ProgramBench: 9 топ моделей, 200 задач, 248 тысяч тестов. Полностью решённых — ноль

200 задач. 248 тысяч поведенческих тестов. Девять моделей, среди них всё свежее на 2026 год: Opus 4.7, GPT 5.4, Gemini 3.1 Pro, Sonnet 4.6, Haiku 4.5. На SWE-bench те же модели стабильно берут 70 % и выше. Здесь — ноль. Полностью решённых задач у самой сильной модели — 3 %. У всех остальных — 0 % и ещё раз 0 %.Это ProgramBench — новый бенчмарк от Meta Superintelligence Labs, Stanford и Harvard, опубликован в 2026 году (paper, github). И он измеряет совсем не то, что измеряют SWE-bench и HumanEval.Чем ProgramBench отличается от других кодинг-бенчмарков

продолжить чтение

Как научить кодинг-модели не переписывать код заново

Не надо переписывать то, что не поломаноКод к этому посту доступен на Github.

продолжить чтение

MiniMax M2.7 — самоэволюционирующая модель с упором на coding, Office-задачи и агентные сценарии

Китайская компания MiniMax 18 марта выпустила модель M2.7, которая участвовала в собственном обучении. Это не просто очередная LLM, а система, которая может автономно улучшать себя и свои процессы.Сразу на ваш суд промо-ролики:Отладка проблемы на уже работающем сервисе:M2.7 сгенерировала демо-страницу:

продолжить чтение

L в аббревиатуре LLM означает «ложь»

Если верить хайпу, та отрасль разработки ПО, к которой мы привыкли, уже мертва. Однако странно, что, несмотря на годы работы с ИИ-инструментарием, результаты выглядят, ощущаются и работают примерно так же, как и в начале: невзрачно.

продолжить чтение

12