оптимизация контекста.

Почему ИИ-агент сжигает токены: как я снизил стоимость сессии с 48 до 8 рублей

На тридцатом шаге мой ИИ-агент отправлял нейросети 123 856 входных токенов. Один запрос весил как небольшой роман и стоил соответственно. При этом большая часть контекста уже приезжала раньше: логи, прочитанные файлы, старые ответы инструментов и описания тех инструментов, которые на этом шаге вообще не использовались.Я начал резать повторный контекст. Сначала на сервере, потом на компьютере пользователя. За два дня вокруг простой идеи выросли локальный архив, оглавление сессии, загрузка схем инструментов по требованию и песочница для вычислений.

продолжить чтение