LLM-агенты.

Я заставил ИИ‑агента работать по протоколу тушения пожаров. За шесть дней он переписал сам себя 10 раз

В какой‑то момент я перестал доверять фразе «готово» от языковой модели.Модель при этом не врёт: она честно считает, что сделала работу. Она пишет «реализовано, тесты проходят», и чаще всего так и есть. Беда в остальных случаях, когда модель поправила один вызов из четырёх, приняла собственный план за выполненную работу и закрыла задачу. Диалог при этом выглядит безупречно до самого конца.Я перепробовал обычный набор: писал развесистые CLAUDE.md

продолжить чтение

502 на ingress, 302 в приложении: как я учил инфраструктурного LLM-агента не врать

Сначала контекст. Я делаю внутреннего read-only агента для инфраструктурных расследований: он может читать данные, но не изменять production. Инженер пишет ему в Mattermost или резервном web-чате обычный вопрос: «почему сервис отдаёт 502?», «кто выкатил эту версию?» или «что изменилось перед инцидентом?». Агент сам собирает данные из Kubernetes, VictoriaMetrics, Elasticsearch, GitLab, Grafana, GSLB и других эксплуатационных источников, а затем возвращает ответ с доказательствами и явно перечисленными пробелами.

продолжить чтение

Агенты, или Путешествие к LLM и обратно

Агенты сейчас обсуждают все подряд. Меняются фреймворки, появляются MCP-серверы, облака обещают «агента из коробки». Но в центре любой такой схемы по-прежнему одна и та же вещь — LLM: она читает контекст и формулирует следующий шаг. А между запросом к агенту и самой моделью — ещё несколько слоёв.

продолжить чтение

LLM-wiki против RAG: Оцениваем и сравниваем

Про LLM-wiki здесь уже было несколько хороших статей (1, 2 и 3), поэтому подробно останавливаться на идее Andrej Karpathy не буду. В двух словах: вместо RAG-ретривера - wiki-агент, вместо чанков из сырых документов - связанные концепт-страницы, вместо обновления - перекомпиляция и поиск «битых» ссылок.

продолжить чтение

Запрещаем AI выдумывать методы КОМПАС-3D: 200К пар обучения, модель на 34М и KOMPAS Guard в одном процессе

С чего все началосьKOMPAS Guard - это набор инструментов, который бьет AI-агента по рукам, когда тот пытается выдумать несуществующий код для КОМПАС-3D.В первой версии мы решили главную проблему: заставили агента опираться на факты. Существование методов доказывал граф типов, сигнатуры сверял компилятор C#, а отдельный процесс запускал код в реальном CAD. После этого соврать агент уже физически не мог.Зато всплыла другая беда: разрыв между человеческим языком и документацией. Граф типов знает все про IPart7.DefaultObject

продолжить чтение

1002 хендоффа за 60 дней: как я собрал шину координации для 12 Claude-агентов

Шестьдесят дней назад я держал всю координацию своего SaaS в голове. Двенадцать вкладок Claude Code, в каждой своя роль: техлид, аналитик, тестировщик, медиабайер. Я переключался между ними и был единственным местом, где эти вкладки узнавали друг о друге.Сейчас в очереди 1002 задачи, из них 954 закрыты. Медиана от постановки до закрытия составляет 47 минут. Вся координация умещается в 600 строк Python на стандартной библиотеке и один markdown-файл.

продолжить чтение

Сколько стоит контекст для кодового агента: grep vs граф vs LSP на большом проекте (936 прогонов)

Продолжение статьи про graphlens. Там я описал, что инструмент делает и как устроен, и по дороге уверенно заявил, что «агент жжёт токены, бегая grep'ом по репозиторию». Заявил — но ни одной цифры не привёл. Эта статья закрывает дыру: вот замеры, вот данные, вот воспроизводимый стенд. Спойлер: вывод оказался не таким, каким я его себе рисовал, и это самое интересное.КороткоЯ взял одного и того же агента (Claude Code), менял у него ровно одну вещь — какой MCP-сервер отдаёт контекст по коду, — и гонял по 26 задачам на apache/superset. Четыре «руки»: filesystem

продолжить чтение

KiSinWi — AutoML-платформа с микросервисной архитектурой и мультиагентными воркфлоу

Знаете это чувство, когда обучаешь классификатор изображений в десятый раз и ловишь себя на мысли, что делаешь ровно то же самое, что и в прошлый раз? Поменять архитектуру, подкрутить learning rate, добавить аугментацию, подождать, посмотреть на кривые, вздохнуть, поменять ещё раз. Рутина, которую вроде бы знаешь наизусть и именно поэтому она бесит больше всего.В какой-то момент (прошлой осенью) я подумал: а почему этим до сих пор занимаюсь я, а не модель, которая в этом разбирается не хуже (ну наверное)? Так началась KiSinWi

продолжить чтение

Prompt caching для тех, кто строит LLM-агентов

продолжить чтение

Десять лет в индустрии я писал код руками. Три месяца назад перестал

После выхода Claude Opus 4.7 стало очевидно, что агент технически быстрее меня. А 28 мая Anthropic выпустила Opus 4.8 с теми же ценами, заметно лучшим coding/agentic-скором и новой возможностью держать в голове миграции на сотни тысяч строкИ всё же расслабиться не выйдет, потому что есть нюанс: эрудиция у него принципала, а суждения джуна. Он знает двадцать способов решить задачу и ни одной причины предпочесть один другому - потому что не ему потом это поддерживать

продолжить чтение