- BrainTools - https://www.braintools.ru -

Сколько стоит месяц с AI-агентом: API против подписок

В августе 2026 я показывал своим коллегам на митапе таблицу с месячной стоимостью работы через разные модели. Через месяц открыл её снова — половина цифр уже устарела. DeepSeek ввёл пиковые тарифы, Z.ai перевёл GLM Coding Plan на кредиты, появились новые модели. Пришлось пересчитать всё заново по ценам на 16 сентября и заодно разобраться, что выгоднее: платить за API или покупать подписки.

Что я считал

За основу я взял месяц обычной работы с агентом: 492 миллиона новых входных токенов, 2,3 миллиарда токенов, прочитанных из кэша, 10 миллионов выходных и примерно 25 тысяч запросов. Понятно, что у всех своя модель потребления, это средний по больнице. Но на нём хорошо видна одна вещь, которую легко пропустить: 82% всего объёма — это кэш. В среднем запрос весит около 112 тысяч токенов, и почти весь он уже был отправлен раньше.

Вот как я считал: объём каждого типа токенов умножал на цену за миллион. Запись в кэш, которую Anthropic и OpenAI тарифицируют отдельно, в расчёт не входит, поэтому для Claude и GPT реальная сумма будет выше. Для Opus 5 при стандартном пятиминутном TTL наценка в четверть цены входа добавила бы примерно $615. При часовом TTL запись стоит вдвое дороже обычного входа и добавила бы уже $2 460 (документация Anthropic по кэшированию [1]).

Как кэш меняет стоимость

Раньше экономия токенов выглядела так: сократить промпт, выкинуть лишнее, кто-то даже вырезал из промпта пробелы и убирал буквы. Сейчас одного этого недостаточно. Модель ничего не помнит между вызовами, и харнес — Claude Code, OpenCode, Cursor — на каждом ходу снова отправляет ей системный промпт, описания инструментов и историю. Зато провайдеры дают большую скидку на повторное чтение того же начала промпта. У большинства моделей Anthropic чтение кэша стоит 0,1 от цены входа, а у Fable 5.1 — 0,025; у OpenAI скидка достигает 90% (документация OpenAI [2]). Большой, но стабильный промпт может оказаться дешевле маленького, который постоянно меняется.

Сколько харнес отправляет без нашего участия, я проверил на Claude Code. Только что запущенная сессия уже занимала около 45 тысяч токенов: системный промпт, инструменты, файлы памяти [3]. На одно слово «привет» ушло ещё 18 тысяч. Стоимость определяет не то, что я напечатал, а то, что агент фактически передал. Сама модель диалог не хранит: состояние живёт в харнесе, а на следующем ходу он снова отправляет текущий контекст — исходную историю или её сжатую версию. Если харнес что-то не отправил, модель этого не знает. Подробнее о том, почему большое окно не решает задачу памяти, я писал отдельно [4].

Отсюда правила, которые реально экономят деньги:

  • Кэш работает по совпадающему началу. Изменили что-то в начале — всё, что дальше, снова стоит полную цену.

  • Не меняйте начало промпта посреди сессии. Не переподключайте MCP-серверы и не правьте правила, которые входят в системный промпт: у Anthropic изменение описаний инструментов инвалидирует кэш целиком.

  • Подключайте MCP-серверы и скиллы на уровне проекта, а не глобально. Их описания уезжают в каждый вызов.

  • Следите за TTL. У Anthropic API стандартный TTL — пять минут, расширенный — час. В Claude Code на подписке Pro или Max в пределах включённого лимита собственные ходы пользователя и часть служебных запросов получают часовой TTL автоматически. При переходе на usage credits они возвращаются к пяти минутам, если явно не выставить promptCacheTtl: 1h (документация Claude Code [5]). У GPT-5.6 и более новых моделей OpenAI минимальный TTL — 30 минут. Кэш всё равно не постоянная память: после долгого перерыва начало промпта снова придётся записать.

  • Не режьте стабильную часть промпта вслепую. Агенту не хватит контекста, он начнёт читать файлы и вызывать инструменты, и итоговый счёт за сессию вырастет.

На своей статистике Claude Code я вижу ещё более кэшированный профиль: 98% всех токенов — чтение из кэша. Именно поэтому цифры дальше так сильно расходятся.

Стоимость через API

Вот сколько стоит тот же месяц, если платить за API по прайсу. Цены взяты с официальных страниц провайдеров на 16 сентября: Anthropic [6], OpenAI [7], Alibaba Cloud [8], Kimi [9], xAI [10], Z.ai [11], DeepSeek [12], MiniMax [13]. Я использовал обычный тариф: средний запрос в этом примере — 112 тысяч токенов. Если отдельные запросы переходят long-context порог провайдера, соответствующая строка будет дороже, поэтому таблица даёт нижнюю оценку.

Модель

Вход / кэш / выход, $ за 1M

$ в месяц

GPT-6 Astra*

10 / 1 / 50

7 720

Claude Fable 5.1*

10 / 0,25 / 50

5 995

Claude Opus 5*

5 / 0,50 / 25

3 860

GPT-5.6 Sol*

4 / 0,40 / 20

3 088

Qwen 3.7 Max

2,50 / 0,50 / 7,50

2 455

Kimi K3

3 / 0,30 / 15

2 316

Grok 4.5

2 / 0,30 / 6

1 734

Qwen 3.8 Max

2 / 0,25 / 6

1 619

GPT-5.6 Terra*

2 / 0,20 / 12

1 564

GLM-5.3 и GLM-5.2

1,40 / 0,26 / 4,40

1 331

MiniMax M3

0,30 / 0,06 / 1,20

298

DeepSeek V4.1 Flash, пик / вне пика

0,30 / 0,006 / 1,20 и вдвое дешевле

173 / 87

GPT-5.6 Luna*

0,20 / 0,02 / 1,20

156

* Без учёта записи в кэш. Для Opus 5 это ещё +$615 при пятиминутном TTL и +$2 460 при часовом, для остальных отмеченных моделей — пропорционально цене входа.

Anthropic выпустила Fable 5.1 с кэшем в четыре раза дешевле, чем у Fable 5, а цены Opus 5 не менялись. OpenAI снизила цену GPT-5.6 Sol [14] до $4 за вход и $20 за выход — это промо, как минимум до 21 ноября — и выпустила GPT-6 Astra. В линейке 5.6 Sol самая большая модель, Terra средняя, Luna самая маленькая.

С китайскими моделями история обратная. DeepSeek в августе ввёл пиковые тарифы [15]: по будням с 04:00 до 07:00 и с 09:00 до 13:00 по Москве всё стоит вдвое дороже. То есть в первой половине нашего рабочего дня. 10 сентября вышел DeepSeek V4.1 Flash [16], и он дешевле прежнего V4 Flash. Kimi K3 по API обходится почти как Sol. GLM-5.3 по API стоит столько же, сколько GLM-5.2.

Между Astra и DeepSeek V4.1 Flash вне пика разница почти в девяносто раз: $7 720 против $87. А если бы кэша не было и весь вход стоил полную цену, тот же месяц на Opus 5 обошёлся бы не в $3 860, а примерно в $14 000.

Подписки на открытые модели

В таблице, которую я показывал в августе, подписки считались по запросам. Например, у OpenCode Go для DeepSeek V4 Flash написано, сколько запросов в месяц даёт одна подписка, делим на наши 25 тысяч и получаем число подписок. Выглядело очень выгодно. Но у Go лимиты заданы в долларах [17], а число запросов — только оценка на запросах определённого размера. Наши запросы в несколько раз тяжелее: каждый тащит за собой сотню тысяч токенов кэша. Если пересчитать через доллары, картина другая.

Модель в OpenCode Go

Лимит в месяц

Запросов по оценке Go

Наш месяц по API

Нужно подписок, примерно

DeepSeek V4.1 Flash

$60 до 20 сентября, затем $15

130 000 / 32 500

$87–173

2–3 / 6–12

Qwen 3.7 Plus

$60

21 600

$305

6

GLM-5.2

$60

4 300

$1 331

23

GPT-5.6 Luna

$15

10 250

$156

11

Kimi K3

$15

490

$2 316

155

OpenCode Go стоит $10 в месяц, скидки на первый месяц больше нет. Получается, что Go даёт в полтора–шесть раз больше, чем стоит, и это хорошее предложение. Четырёхкратный лимит для V4.1 Flash — временная акция до 20 сентября; без неё одной подписки на наш месяц хватает только на небольшую часть объёма. Купить несколько подписок в одном workspace не получится: Go разрешает подписаться только одному его участнику.

С GLM Coding Plan от Z.ai можно посчитать точнее, потому что формула кредитов опубликована [18]. Наш месяц на GLM-5.3 — это примерно 174 тысячи кредитов в неделю в пиковые часы. Вне пика кредиты списываются вдвое медленнее, а пик у Z.ai совпадает с утренним окном DeepSeek: 09:00–13:00 по Москве в будни. План Max за $168 [19] даёт 140 тысяч кредитов в неделю: если работать вне пика, одного хватит, если только в пик — нужно два, то есть $336. Против $1 331 по API это в четыре–восемь раз дешевле. Запросы к GLM-5.2 в подписке теперь автоматически уходят на GLM-5.3.

Ollama Cloud в августе я не считал, потому что цифр у них не было. С 31 августа они перешли на кредиты в долларах [20]: Pro за $20 даёт $60 использования в месяц, Max за $100 — $300. То есть подписка даёт в три раза больше, чем стоит.

Claude Code и Codex

Самые щедрые лимиты сейчас у Claude Code. Anthropic их в токенах не публикует, поэтому могу опираться только на встроенную статистику. У меня подписка Max 20x за $200; показанный Claude Code эквивалент по API-прайсу за последние два месяца был более чем в сто раз выше цены подписки. Это личный профиль потребления, а не обещание тарифа. До 13 сентября действовала акция: недельный лимит в Claude Code был на 50% выше. С 14 сентября он остаётся на 25% выше [21], чем был до акции.

О своём переходе с Claude Code на Hermes Agent я писал отдельно [22].

Следующий по щедрости — Codex. OpenAI публикует лимиты в сообщениях за пять часов [23], про токены там ничего нет, и сама пишет, что это оценки, а не фиксированные лимиты. Поэтому точно посчитать нельзя, только прикинуть. По моей оценке, на GPT-5.6 Sol нашему месяцу нужно четыре подписки Pro 5x за $100 или одна Pro 20x за $200. Но новые подписки и апгрейды на Pro 20x OpenAI с 10 сентября временно приостановила [24]. Для Luna хватает Plus за $20.

С Cursor ситуация другая. Сторонние модели там списываются по цене API [25], а сколько использования включено в тариф, на официальных страницах больше не пишут. Для наших объёмов Cursor стоит примерно как API, и на Teams-тарифах сверху добавляется $0,25 [26] за каждый миллион токенов.

Почему это не навсегда, понятно из тех же цифр. Спонсировать каждому пользователю тысячи долларов в месяц компании бесконечно не смогут. Прайсы, акции и лимиты уже несколько раз менялись, подписки пока держатся. На митапе я говорил, что постепенно лимиты будут снижаться, а цены — расти.

Бенчмарки и цена

Я попытался привести цену к качеству: взял LiveBench [27], SWE-Bench Pro [28] и Terminal-Bench 2.1 [29], сравнил каждую модель с GPT-5.6 Sol и пересчитал стоимость через получившийся коэффициент. Честного коэффициента не получилось: в Terminal-Bench модели запускались разными харнесами, для части моделей нет результата по одному из тестов, а названия в таблицах относятся к разным версиям и режимам усилия. Поэтому «цену с поправкой на качество» я публиковать не стал. Бенчмарки помогают выбрать кандидатов для своей проверки, но не переводят качество в доллары.

Как я теперь выбираю модель

Для повседневной работы — писать код по готовой спецификации, чинить баги, отлаживать — не нужна самая умная модель. С этим отлично справляются GPT-5.6 Luna и DeepSeek 4 Flash, а стоят они в десятки раз дешевле флагманов. Документацию, архитектуру и сложную аналитику лучше отдать Opus или Sol. У меня работает и связка: сначала дешёвая модель пишет документ, потом Opus его исправляет. В таких задачах дорогая модель получает уже собранный контекст вместо того, чтобы начинать с нуля.

Если платить из своего кармана, то сейчас выгоднее всего подписки Claude и Codex под сложные задачи и дешёвые модели по API или через OpenCode Go под рутину. GLM Coding Plan и Ollama Cloud тоже хороши, особенно если основная работа приходится не на утро. Кому это не подойдёт: тем, кому нужна предсказуемость. Лимиты подписок не опубликованы и меняются, у китайских провайдеров цена зависит от часа, а промо-цены вроде Sol закончатся в ноябре.

Выводы

  1. Типичный месяц работы с агентом — это миллиарды токенов, и большая часть из них — повторно отправленный контекст. Поэтому сравнивать провайдеров по одной цене входа бессмысленно.

  2. Следить нужно не за числом токенов, а за долей попаданий в кэш. Всё, что меняет начало промпта посреди сессии, стоит полную цену за весь накопленный контекст.

  3. Sol подешевел, DeepSeek ввёл пиковые тарифы, но разрыв между самыми дорогими и самыми дешёвыми моделями всё равно в десятки раз.

  4. Лимиты подписок в запросах обманчивы: они посчитаны на лёгких запросах. Переводите свой расход в доллары по API и делите на долларовый лимит.

  5. Подписки Anthropic и OpenAI сейчас дают в десятки раз больше, чем стоят, но их лимиты не опубликованы и могут поменяться в любой момент.

  6. Не превращайте разрозненные бенчмарки в один «коэффициент качества»: точность такого числа будет мнимой.

  7. Модель выбирается под задачу: дешёвая на рутину, дорогая на то, где действительно нужен ум.

Цифры в этой статье актуальны на 16 сентября. Судя по тому, как быстро устарела моя августовская таблица, через месяц их снова придётся пересчитывать.

Автор: shady2k

Источник [30]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/35615

URLs in this post:

[1] документация Anthropic по кэшированию: https://platform.claude.com/docs/en/build-with-claude/prompt-caching

[2] документация OpenAI: https://developers.openai.com/api/docs/guides/prompt-caching

[3] памяти: http://www.braintools.ru/article/4140

[4] писал отдельно: https://shady2k.ru/posts/ai-agent-memory/

[5] документация Claude Code: https://console.anthropic.com/docs/en/agent-sdk/cost-tracking

[6] Anthropic: https://www.anthropic.com/pricing

[7] OpenAI: https://developers.openai.com/api/docs/pricing

[8] Alibaba Cloud: https://www.alibabacloud.com/help/en/model-studio/model-pricing

[9] Kimi: https://platform.kimi.ai/docs/pricing/chat-k3

[10] xAI: https://docs.x.ai/developers/pricing

[11] Z.ai: https://docs.z.ai/guides/overview/pricing

[12] DeepSeek: https://api-docs.deepseek.com/quick_start/pricing

[13] MiniMax: https://platform.minimax.io/docs/guides/pricing-paygo

[14] снизила цену GPT-5.6 Sol: https://developers.openai.com/api/docs/changelog

[15] ввёл пиковые тарифы: https://api-docs.deepseek.com/news/news260813

[16] вышел DeepSeek V4.1 Flash: https://www.deepseek.com/en/news/deepseek-v4-1-flash

[17] лимиты заданы в долларах: https://opencode.ai/docs/go

[18] формула кредитов опубликована: https://docs.z.ai/devpack/overview

[19] План Max за $168: https://z.ai/subscribe?plantype=individual

[20] перешли на кредиты в долларах: https://ollama.com/blog/transparent-pricing

[21] остаётся на 25% выше: https://support.claude.com/en/articles/15910845-claude-code-may-august-2026-weekly-limits-promotion

[22] писал отдельно: https://shady2k.ru/posts/hermes-agent-vs-claude-code/

[23] публикует лимиты в сообщениях за пять часов: https://developers.openai.com/codex/pricing

[24] временно приостановила: https://help.openai.com/en/articles/9793128-about-chatgpt-pro-tiers

[25] списываются по цене API: https://cursor.com/docs/models-and-pricing

[26] добавляется $0,25: https://cursor.com/docs/account/teams/pricing

[27] LiveBench: https://livebench.ai/

[28] SWE-Bench Pro: https://benchlm.ai/benchmarks/swe-bench-pro

[29] Terminal-Bench 2.1: https://www.tbench.ai/leaderboard/terminal-bench/2.1

[30] Источник: https://habr.com/ru/articles/1083220/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1083220

www.BrainTools.ru

Rambler's Top100