Токенная диета для ИИ-агентов: Caveman, Ponytail и Headroom
У агентных помощников есть неприятная привычка: они быстро раздувают работу.Сначала длинный ответ там, где хватило бы одной команды. Потом новый слой кода вокруг задачи на пять строк. Потом в контекст улетает полный лог, JSON на сотни элементов и кусок истории, который уже никто руками не читает.Каждая отдельная вещь выглядит терпимо. В длинной сессии это превращается в счет у провайдера, раннее сжатие истории, забитое окно контекста и потерянные детали. Агент вроде продолжает работать, но внезапно забывает ограничение, на котором держалась задача.
Куда делись мои токены?
Когда начинаешь плотно работать с AI-агентом, кажется, что бОльшая часть токенов улетает на сложные процессы - код написать, сайт разобрать, статью подготовить, браузером поуправлять, в логах покопаться. Вроде логично, задача сложная, модель думает, инструменты дергает, контекст растет.
Граф кода одной командой: ставим graphlens-mcp в проект и перестаём жечь токены на grep
Третья часть серии. В первой я разбирал сам движок graphlens — что он делает и как устроен внутри. Во второй гонял бенчмарк на 936 прогонов и смотрел, где граф реально окупается, а где проще остаться с grep. Здесь — про то, что осталось за кадром в обеих частях: движок это ещё не инструмент, и чтобы подключить его к агенту, поверх нужно дописать прилично кода. Вот этот код я и собрал в отдельный продукт. graphlens-mcp ставится одной командой, дальше работает сам. Он в alpha, бесплатный (MIT), и прогнать его на своём проекте можно минут за пять.
Посчитал, сколько токенов Claude тратит на «Конечно!» и «Отлично!». 11% счёта
Открыл вчера дашборд по потреблению токенов — и завис.Смотрю на график и понимаю — что-то не сходится. Задач у ассистента за месяц было плюс-минус столько же, что и в прошлом. А токенов на выходе — больше процентов на десять. Я было решил, что это очередной клиент раскочегарился, полез в разбивку по проектам — нет, у всех понемногу.Ну.Полез читать сами ответы модели. И первое, что бросилось в глаза — почти каждый начинается с «Конечно!», «Отличный вопрос!», «С радостью помогу!». А дальше идёт ещё полтора-два предложения про то, как модель собирается ответить. И только потом — собственно ответ.

