- BrainTools - https://www.braintools.ru -

В начале августа по X разошёлся скриншот: панель расходов, сотни миллионов обработанных токенов и счёт чуть больше доллара. Работа велась через открытый Hermes Agent на модели DeepSeek V4 Flash. Скриншот [1] – личный дашборд пользователя, проверить его со стороны нельзя, поэтому дальше речь не о том, правдив ли конкретный счёт, а о том, какая механика делает такой счёт возможным и в какой момент она перестаёт работать.
TL;DR
Hermes Agent — открытый автономный агент от Nous Research под MIT, работает с любым OpenAI-совместимым эндпоинтом.
DeepSeek V4 Flash в публичной бете с 31 июля: та же архитектура, что у апрельского превью, заметно подтянутые агентские способности после дообучения.
Основную экономию даёт не низкая ставка сама по себе, а автоматическое кэширование префикса: повторяющееся начало запроса считается по ставке в десятки раз ниже обычной.
Агентский цикл попадает в эту механику почти идеально, он раз за разом отправляет один и тот же системный промпт и историю шагов, дописывая пару строк в конец.
Ломается экономия на мелочах в шапке промпта: метка времени, идентификатор сессии, перетасованный порядок инструментов.
Заявленное превосходство младшей модели над старшей, по агентским бенчмаркам вендора; на тяжёлом рассуждении DeepSeek сама рекомендует уходить на V4-Pro.
Надбавка за часы пик анонсирована, но на момент публикации не включена, её стоит заложить в план заранее.
Hermes Agent вышел в феврале, десктопная сборка под macOS, Windows и Linux появилась в июне. Лицензия MIT, репозиторий открыт. Nous Research позиционирует его как автономного агента с замкнутым циклом обучения [2]: закончив задачу, агент оценивает результат, записывает найденный способ в markdown-файл навыка и переиспользует его в следующих сессиях. Память [3] сохраняется между запусками, формат навыков совместим с открытым стандартом agentskills.io [4].
Практическая часть: терминал, файловые операции, браузер, выполнение кода, генерация изображений, планировщик задач, подключение к MCP-серверам. Запускается локально, в Docker, по SSH, а также на serverless-площадках вроде Daytona и Modal, где простаивающее окружение почти ничего не стоит. Общаться с ним можно из Telegram, Slack, почты и ещё двух десятков каналов.
Заявление про «самообучение» стоит читать буквально и без энтузиазма: агент пишет себе процедурные заметки и подтягивает их в контекст. Веса модели при этом не меняются, никакого дообучения на лету здесь нет.
Вся арифметика держится на одном свойстве DeepSeek API — автоматическом кэшировании начала запроса. Если новый вызов повторяет префикс, который модель недавно видела, повторённая часть тарифицируется по отдельной, сильно сниженной ставке. Никаких заголовков и флагов включать не нужно, механика работает сама.
Порядок ставок на V4 Flash, чтобы держать картину в голове одной таблицей:
|
Что тарифицируется |
Ставка за 1 млн токенов |
|---|---|
|
Вход, промах кэша |
$0,14 |
|
Вход, попадание в кэш |
$0,0028 |
|
Выход |
$0,28 |
Разрыв между двумя строками входа — пятьдесятикратный. Это единственная цифра из таблицы, которую имеет смысл запомнить: всё остальное — следствие.
Теперь почему именно агенту это выгодно. Агентский цикл устроен так, что каждый следующий вызов отправляет ровно то же, что предыдущий, плюс несколько новых строк: системный промпт, описания инструментов, файлы проекта, историю уже сделанных шагов. Доля неизменной части в общем объёме входа доходит до девяноста с лишним процентов. Стабильная шапка уходит в кэш, реальные деньги остаются только за то, что модель генерирует в ответ.
У чат-бота или разовой обработки документов эта доля кратно ниже, и там та же модель обойдётся заметно дороже на сопоставимом объёме. Дешевизна — свойство сценария, а агентский цикл просто оказался самым удачным его представителем.
Здесь начинается практическая часть, ради которой стоит читать дальше.
Кэш держится на побайтовом совпадении префикса. Любой элемент, который меняется от вызова к вызову и стоит в начале, обнуляет попадание для всего, что идёт после него. Типовые виновники:
метка текущего времени или даты в системном промпте;
идентификатор сессии, запроса или пользователя, подставленный в шапку;
список инструментов, который сериализуется из словаря без фиксированного порядка;
динамически подставляемый список файлов рабочей директории;
«свежие» фрагменты RAG, вставленные перед основным контекстом, а не после него.
Правило: неизменное — в начало, переменное — в хвост. Проверять эффект удобнее всего по счётчику cache-hit в панели провайдера: если доля попаданий заметно ниже ожидаемой, ищите движущийся элемент в первых килобайтах промпта.
Отдельно про переключение моделей. Кэш привязан к конкретной модели, и гибридная маршрутизация с эскалацией на старшую версию сбрасывает накопленный префикс. Экономически это всё равно оправдано, но закладывать в расчёт «дешёвый вход» для эскалированных вызовов не стоит.
Августовская сборка V4 Flash сохранила архитектуру апрельского превью и получила дополнительное дообучение под агентские задачи. По девяти опубликованным агентским бенчмаркам она обходит превью старшей модели V4-Pro — на Terminal-Bench 2.1 разрыв заметный, на DeepSWE прирост относительно собственного превью многократный.
Оговорки, которые здесь важны:
это бенчмарки вендора на агентских сценариях, а не независимая оценка на вашем коде;
«обходит старшую модель» относится к превью-версии V4-Pro, полный релиз которой на момент публикации ещё не вышел;
на длинном многошаговом рассуждении, олимпиадной математике [5] и тяжёлой отладке DeepSeek сама рекомендует уходить на Pro.
Отсюда вытекает рабочая схема: весь трафик по умолчанию на Flash, эскалация на Pro только по срабатыванию проверки качества. Разница в цене между ними на смешанной нагрузке примерно трёхкратная, так что гибридная маршрутизация обходится дёшево.
Надбавка за часы пик. DeepSeek анонсировала удвоение ставок в двух дневных окнах. На момент публикации официальный прайс держит единую ставку без временных тиров, но надбавка привязана к полному релизу V4. Пакетную нагрузку, которой не нужна срочность, разумно с самого начала планировать вне этих окон.
удвоение ставок в двух окнах по будням, 01:00–04:00 и 06:00–10:00 UTC.
Лимиты. DeepSeek публикует только ограничение по одновременным запросам, RPM и TPM в документации отсутствуют. Автоматических тиров нет: потолок не растёт ни от объёма трат, ни от возраста аккаунта, поднимается он отдельным обращением в поддержку. При 429 корректная реакция [6] — сократить число запросов в полёте и уйти в экспоненциальный бэкофф, а не расширять параллелизм.
Периметр. Агент с доступом к терминалу и файловой системе работает на вашей машине или вашем сервере. В Hermes Agent есть подтверждение команд, разграничение прав и изоляция в контейнере — включать их стоит на старте. Содержимое проекта при этом уходит на серверы провайдера, и для клиентской работы это отдельный пункт для сверки с договором.
Привязка к провайдеру. Веса V4 Flash выложены открыто, так что запасной вариант с самостоятельным хостингом существует. Считать его дешёвой альтернативой не стоит — модель крупная, но как страховка от изменения прайса он рабочий.
Короткий чек-лист перед тем, как переносить эту связку на боевую нагрузку:
Доля попаданий в кэш на реальной сессии — если она не выходит на высокие значения, экономики не будет, и виновата почти всегда шапка промпта.
Стабильность порядка сериализации инструментов и контекстных файлов между вызовами.
Доля вызовов, которые пришлось эскалировать на старшую модель, — она определяет реальную среднюю цену задачи.
Поведение [7] при 429 под нагрузкой: очередь и бэкофф вместо расширения параллелизма.
Что именно из рабочего проекта уходит в запросы и допустимо ли это по вашему договору.
Скриншот с копеечным счётом — не характеристика модели, а характеристика аккуратно собранного промпта. Те же объёмы при небрежной шапке дадут счёт другого порядка, и это единственный вывод, который переносится на любую другую связку.
А у кого на длинных агентских сессиях получалось удерживать высокую долю попаданий в кэш — и что чаще всего её сбивало?
Источники: DeepSeek API Pricing [12], Nous Portal [13]
Автор: stas-clear
Источник [14]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/33986
URLs in this post:
[1] Скриншот: https://neuro-ai.ru/upload/000/u1/7/3/e7d14775.jpg
[2] обучения: http://www.braintools.ru/article/5125
[3] Память: http://www.braintools.ru/article/4140
[4] agentskills.io: http://agentskills.io
[5] математике: http://www.braintools.ru/article/7620
[6] реакция: http://www.braintools.ru/article/1549
[7] Поведение: http://www.braintools.ru/article/9372
[8] Hermes Agent — документация: https://hermes-agent.nousresearch.com/docs/
[9] Hermes Agent на GitHub: https://github.com/NousResearch/hermes-agent
[10] DeepSeek V4 Flash на OpenRouter: https://openrouter.ai/deepseek/deepseek-v4-flash
[11] Веса DeepSeek-V4-Flash на Hugging Face: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
[12] DeepSeek API Pricing: https://api-docs.deepseek.com/quick_start/pricing
[13] Nous Portal: https://portal.nousresearch.com/
[14] Источник: https://habr.com/ru/articles/1066896/?utm_campaign=1066896&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.