Я заставил ИИ‑агента работать по протоколу тушения пожаров. За шесть дней он переписал сам себя 10 раз
В какой‑то момент я перестал доверять фразе «готово» от языковой модели.Модель при этом не врёт: она честно считает, что сделала работу. Она пишет «реализовано, тесты проходят», и чаще всего так и есть. Беда в остальных случаях, когда модель поправила один вызов из четырёх, приняла собственный план за выполненную работу и закрыла задачу. Диалог при этом выглядит безупречно до самого конца.Я перепробовал обычный набор: писал развесистые CLAUDE.md
502 на ingress, 302 в приложении: как я учил инфраструктурного LLM-агента не врать
Сначала контекст. Я делаю внутреннего read-only агента для инфраструктурных расследований: он может читать данные, но не изменять production. Инженер пишет ему в Mattermost или резервном web-чате обычный вопрос: «почему сервис отдаёт 502?», «кто выкатил эту версию?» или «что изменилось перед инцидентом?». Агент сам собирает данные из Kubernetes, VictoriaMetrics, Elasticsearch, GitLab, Grafana, GSLB и других эксплуатационных источников, а затем возвращает ответ с доказательствами и явно перечисленными пробелами.
Агенты, или Путешествие к LLM и обратно
Агенты сейчас обсуждают все подряд. Меняются фреймворки, появляются MCP-серверы, облака обещают «агента из коробки». Но в центре любой такой схемы по-прежнему одна и та же вещь — LLM: она читает контекст и формулирует следующий шаг. А между запросом к агенту и самой моделью — ещё несколько слоёв.
LLM-wiki против RAG: Оцениваем и сравниваем
Про LLM-wiki здесь уже было несколько хороших статей (1, 2 и 3), поэтому подробно останавливаться на идее Andrej Karpathy не буду. В двух словах: вместо RAG-ретривера - wiki-агент, вместо чанков из сырых документов - связанные концепт-страницы, вместо обновления - перекомпиляция и поиск «битых» ссылок.
1002 хендоффа за 60 дней: как я собрал шину координации для 12 Claude-агентов
Шестьдесят дней назад я держал всю координацию своего SaaS в голове. Двенадцать вкладок Claude Code, в каждой своя роль: техлид, аналитик, тестировщик, медиабайер. Я переключался между ними и был единственным местом, где эти вкладки узнавали друг о друге.Сейчас в очереди 1002 задачи, из них 954 закрыты. Медиана от постановки до закрытия составляет 47 минут. Вся координация умещается в 600 строк Python на стандартной библиотеке и один markdown-файл.
Сколько стоит контекст для кодового агента: grep vs граф vs LSP на большом проекте (936 прогонов)
Продолжение статьи про graphlens. Там я описал, что инструмент делает и как устроен, и по дороге уверенно заявил, что «агент жжёт токены, бегая grep'ом по репозиторию». Заявил — но ни одной цифры не привёл. Эта статья закрывает дыру: вот замеры, вот данные, вот воспроизводимый стенд. Спойлер: вывод оказался не таким, каким я его себе рисовал, и это самое интересное.КороткоЯ взял одного и того же агента (Claude Code), менял у него ровно одну вещь — какой MCP-сервер отдаёт контекст по коду, — и гонял по 26 задачам на apache/superset. Четыре «руки»: filesystem
KiSinWi — AutoML-платформа с микросервисной архитектурой и мультиагентными воркфлоу
Знаете это чувство, когда обучаешь классификатор изображений в десятый раз и ловишь себя на мысли, что делаешь ровно то же самое, что и в прошлый раз? Поменять архитектуру, подкрутить learning rate, добавить аугментацию, подождать, посмотреть на кривые, вздохнуть, поменять ещё раз. Рутина, которую вроде бы знаешь наизусть и именно поэтому она бесит больше всего.В какой-то момент (прошлой осенью) я подумал: а почему этим до сих пор занимаюсь я, а не модель, которая в этом разбирается не хуже (ну наверное)? Так началась KiSinWi
Десять лет в индустрии я писал код руками. Три месяца назад перестал
После выхода Claude Opus 4.7 стало очевидно, что агент технически быстрее меня. А 28 мая Anthropic выпустила Opus 4.8 с теми же ценами, заметно лучшим coding/agentic-скором и новой возможностью держать в голове миграции на сотни тысяч строкИ всё же расслабиться не выйдет, потому что есть нюанс: эрудиция у него принципала, а суждения джуна. Он знает двадцать способов решить задачу и ни одной причины предпочесть один другому - потому что не ему потом это поддерживать

