- BrainTools - https://www.braintools.ru -

Два года подряд планирование ИИ-инфраструктуры [1] строилось на одном допущении: подождите квартал — и то же самое будет стоить дешевле. Модель станет умнее при той же цене, токен подешевеет, а видеокарты за счет обновлений софта и новых линеек выдадут больше мощности. Допущение работало настолько стабильно, что превратилось в проектную константу: закладываем текущую цену, через полгода она сама себя окупит.
В августе константа сломалась сразу с трех сторон. DeepSeek первой из крупных лабораторий подняла цены на API — на 355–371% в пиковые часы — и ввела тарификацию по времени суток. Micron на Hot Chips показала цифру, после которой разговор про «дешевеющее железо» заканчивается: в двухкристальных GPU-сборках память [2] занимает около 90% площади кремния и стоит впятеро дороже DDR5 за бит. А китайские лаборатории выпустили в открытый доступ веса на 1,7 и 2,4 триллиона параметров, которые скачать можно, но развернуть проблемно.
Конференция в Стэнфорде 24–25 августа в этом году оказалась плотнее обычного: почти все крупные игроки одновременно раскрыли архитектуры, которые поедут в стойки в 2027. Общий тренд у всех докладов один — сами вычисления уперлись в память и в сеть, и почти каждая инженерная фича так или иначе касается перемещения данных, а не арифметики.
Итак, по порядку. Флагманом стала стойка Vera Rubin NVL72. Правда, гигантские заявленные [3] цифры из презентации NVIDIA относятся не к одиночной стойке, а к целой сети суперкомпьютеров (конфигурации DSX). Если смотреть первоисточник, общие мощности поражают: 2 ZFLOPS NVFP4 на инференсе и 1,4 ZFLOPS на обучении [4], 11 ПБ памяти HBM4 и суммарная пропускная способность 800 ПБ/с.
NVLink 6 дает 3,6 ТБ/с all-to-all на GPU в домене из 72 ускорителей — плюс 130 TFLOPS вычислений прямо в сети. Вычислительные лотки собраны без кабелей и без вентиляторов: охлаждение жидкостное, теплой водой при 45 °C, то есть без чиллеров вообще. Референсный дизайн «AI Factory» рассчитан на 100 МВт.
Отдельно по сети. Spectrum-X теперь масштабируется до 512 000 GPU без лишнего яруса коммутации (коммутатор Spectrum-6 выдает 102,4 Тбит/с). Сетевые карты ConnectX-9 дают до 1600 Гбит/с на один GPU. При восьмиплоскостной схеме отказ одной плоскости отнимает лишь 10% полосы, а аппаратное восстановление связи идет в 11 раз быстрее софтверного. BlueField-4 получил 64 ядра Arm Neoverse V2 на 1,7 ГГц и 800 Гбит/с собственной сетевой полосы. На NVMe-oF он выдает 1,6 Тбит/с на восьми ядрах и 20 млн IOPS на шестнадцати.
AMD ответила [5] ускорителем MI455X: 432 ГБ HBM4 при 23,3 ТБ/с. Против MI355X с ее 288 ГБ HBM3E это рост пропускной способности примерно в 2,9 раза. Пик на MXFP4 — 40,26 PFLOPS, до четырех раз к предыдущему поколению; MXFP6 и MXFP8 — по 20,13 PFLOPS.
Архитектура чипа. Сборка чиплетная: восемь вычислительных кристаллов сделаны по техпроцессу N2, фабрик-кристаллы и I/O на N3P. Вокруг них установлены 12 стеков HBM4, все это объединено упаковкой CoWoS-L и дает 256 активных процессорных блоков (WGP). Внутри системы интерфейс Infinity Fabric выдает 1,8 ТБ/с на направление, а для внешних подключений используется PCIe Gen6.
Стойка Helios. Она объединяет 72 графических процессора в одном шасси высотой 44OU. Общие характеристики: 31 ТБ памяти HBM4, пропускная способность 1,7 ПБ/с и общая мощность 2,9 EFLOPS. Сетевая подсистема стойки построена на коммутаторах Broadcom и выдает 260 ТБ/с на внутренние связи (scale-up) и 43 ТБ/с на внешние (scale-out). Хосты — 96-ядерные EPYC Venice, питание через 50-вольтовый DC-busbar, охлаждение жидкостное с blind-mate разъемами.
Самое интересное [6] архитектурное решение месяца — Google развела обучение и инференс по разным кристаллам.
Для обучения создан TPU v8t. Он получил шесть стеков HBM. Суперпод из 9 600 таких чипов на 300 стойках выдает 121 EFLOPS на FP4 и 2 ПБ общей памяти. Сеть Virgo масштабируется до 134 000 TPU с полосой 47 Пбит/с; в ней впервые охладили оптику жидкостью. Энергоэффективность (perf/W) выросла примерно вдвое по сравнению с TPU v7 Ironwood.
Для инференса разработан TPU v8i. Здесь архитектура иная: восемь стеков HBM дают больше памяти на единицу вычислительной мощности, плюс увеличена доля быстрой SRAM. Топология BoardFly сокращает маршрут данных максимум до семи прыжков вместо 16 у прежнего 3D-тора. Движок Collective Acceleration Engine берет коллективные операции на себя прямо на I/O-кристалле. С ARM-процессорами Axion чипы связываются в пропорции 2:1.
Meta* показала [8] MTIA 300 (3-нм вычислительный кристалл плюс 5-нм I/O, 216 ГБ HBM3e, 72 processing elements) и MTIA 400. Старшая модель получила восемь стеков HBM3e с пропускной способностью 9,4 ТБ/с, внутреннюю шину на Ethernet со скоростью 1,2 ТБ/с и выдает 12 PFLOPS на FP4. По сравнению с MTIA 200 производительность на вычислениях FP16 выросла в 15 раз, а пропускная способность памяти — в 46 раз. Один домен масштабирования объединяет до 72 таких чипов.
Intel показала инференс-GPU Crescent Island. Он имеет 160 ГБ памяти LPDDR5X в базовой версии (до 480 ГБ в кастомных вариантах), архитектуру Xe3p, 32 ядра Xe и 256 движков XMX. Также Intel анонсировала Xeon 7 «Diamond Rapids» на техпроцессе Intel 18A-P: до 256 производительных ядер без SMT, 1,28 ГБ кэша последнего уровня, 16 каналов DDR5 со скоростью до 8000 MT/s (до 12 800 с MRDIMM) и 128 линий PCIe 6.0. В дата-центрах процессоры, по прогнозам, появятся в 2027 году.
Arm представила серверный CPU под агентские нагрузки: до 136 ядер Neoverse V3 на чип, TSMC N3P, больше 50 млрд транзисторов на чиплет, двенадцать каналов DDR5 и 845 ГБ/с при DDR5-8800, 300 Вт TDP. Groq показала Groq 3 LPX с 3400 выходными токенами в секунду на Gemma 4 31B при контексте 100 000 токенов.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Пока все считали флопсы, Micron [10] на той же конференции показала слайд, который объясняет экономику всего остального. Разрыв между скоростью процессоров и пропускной способностью памяти не сокращается — он расширяется каждое поколение.
Цифры Micron:
HBM требует примерно втрое больше кремния, чем DDR5, на ту же емкость;
кристалл HBM4 несет 256 банков против 32 у DDR5;
в двухкристальных GPU-сборках память занимает около 90% площади кремния;
HBM стоит примерно впятеро дороже DDR5 за бит;
компьют растет примерно втрое каждые два года, пропускная способность HBM — менее чем вдвое.
SK hynix добавила [11] физику. Потолок толщины стека подняли с 720 микрон (так было до HBM3E включительно) до 775 микрон — вровень с толщиной логической пластины. А для 20-Hi обсуждают уже 825–900. Тепловая нагрузка между поколениями HBM выросла в 2,2 раза, и гибридное соединение против MR-MUF снижает тепловое сопротивление примерно на 35% на 20-Hi. При этом для HBM4E гибридное соединение исключено — окно для него сдвинулось к HBM5, то есть ориентировочно на 2029–2030 годы.
По оценке Fubon Research, которую 13 августа ретранслировала [12] TrendForce, HBM4 для GPU NVIDIA идет по 31–32$ за гигабайт против 17–18$ у HBM3E. Для прочих производителей GPU и кастомных ASIC — 35–36$ за гигабайт. Прогноз на третий квартал: контрактные цены обычной DRAM плюс 13–18% квартал к кварталу, NAND — плюс 10–15%.
Дальше начинается то, что чувствует на себе любой, кто в этом году собирал железо или хотя бы принимал в этом участие. В середине августа комплект 32 ГБ DDR5-6000 в рознице стоил около 392$ — против 72$ годом ранее. Набор на 128 ГБ ушел на 3 399$, вдесятеро выше исторического минимума, а по высокоемким комплектам годовой рост приближается к 500%: 64 ГБ DDR5-5600 подорожали со 191$ до 1 118$. Контрактные цены DDR5 прибавили 90–95% в первом квартале и еще 58–63% во втором.
Корейские вендоры при этом законтрактованы. Samsung подписала с Broadcom соглашение по роадмапу HBM4 плюс turnkey-контракт на 2 нм и продвинутую упаковку на сумму порядка 200 млрд $, SK Group и NVIDIA — комплексное соглашение более чем на 500 млрд $. Емкость памяти распродана до конца 2026 года, часть контрактов простирается до 2030-го.
Практический вывод простой: если вы планируете локальный инференс в ближайшее время, память — основная статья расходов, и оптимизация KV-кэша перестала быть дополнением.
За три недели августа в открытый доступ ушли веса четырех моделей, каждая из которых год назад считалась бы фронтиром. Общий объем того, что теперь можно скачать с Hugging Face, измеряется терабайтами.
API открыли [13] 3 августа, веса выложили 12–13. Модель имеет 2,4 трлн параметров, из которых активны 95 млрд. Архитектура построена по принципу MoE на 512 экспертов: на каждый токен активируются 10 маршрутизируемых и один общий. Сеть состоит из 92 слоев, использует комбинацию gated attention и DeltaNet, а обучалась методом multi-token prediction. Нативное контекстное окно составляет 262 144 токена с расширением до 1 010 000.
Бенчмарки из карточки модели: Terminal-Bench 2.1 — 86,6, SWE-bench Pro — 67,7, GPQA Diamond — 92,6. Для сравнения, GPT-5.6 Sol на Terminal-Bench 2.1 дает 88,8, Claude Opus 4.8 — 84,6. API стоит 2$ за миллион входных и 6$ за миллион выходных.
Ложка дегтя — лицензия. Она кастомная: продукты с более чем 100 млн MAU или выручкой свыше 20 млн $ обязаны указывать имя модели в интерфейсе, MaaS-бизнесы с выручкой свыше 50 млн $ в год лицензируются отдельно. В открытых весах, кроме того, только текст — vision и video остались за API.
13 августа. Вышла [14] модель на 1,7 трлн параметров, лицензия MIT — то есть вообще без оговорок. Она поддерживает форматы FP8 для KV-кэша, FP4 для кэша индексатора и MxFP4. Модуль спекулятивного декодирования DSpark включается одним флагом. Доступны три уровня «глубины рассуждений»: low, high и max. Число активных параметров разработчики не раскрыли ни в карточке, ни в документации.
Результаты тестов: Terminal-Bench 2.1 — 87,9, Cybergym — 83,3, DeepSWE — 62,7. В рейтинге Artificial Analysis Intelligence Index модель набрала 53 балла, заняв пятое место из 1 105.
26 августа Z.ai [15] выложила [16] под MIT первую нативно мультимодальную модель линейки GLM-5, обученную на 30 трлн мультимодальных токенов. 320 миллиардов параметров, из них 18 миллиардов — активных. Контекст 1 048 576, вывод до 131 072 токенов.
Архитектурно это гибрид линейного и разреженного внимания [17]: линейное отвечает за локальные зависимости, разреженное — за глобальный retrieval. IndexPool сжимает KV-кэш в 4,4 раза, механизм Manifold-Constrained Hyper-Connections отвечает за эффективность масштабирования. Относительно GLM-4.5 вдвое сокращены и активные параметры, и число слоев.
В тестах модель набрала: Terminal-Bench 2.1 — 84,3 (у Opus 4.8 — 85,0), DeepSWE v1.1 — 63,4 (против 46,2 у GLM-5.2). В рейтинге Artificial Analysis Intelligence Index результат составил 57 баллов, что выше, чем у DeepSeek V4-Pro. Миллион входных токенов стоит 0,15$, выходных — 0,50$, что в 10 раз дешевле предшественника.
За неделю до релиза модель работала на OpenRouter и OpenCode анонимно под кодовым именем Ox Alpha и вызвала волну догадок об авторстве. Обслуживалась она при этом полностью на китайских ускорителях отечественного производства.
В конце месяца Tencent выложила [18] модель на 770 млрд параметров (49 млрд активных) под лицензией Apache 2.0 — одной из самых свободных среди августовских релизов. Архитектура включает 256 маршрутизируемых экспертов и один общий, 78 слоев с Gated DeepSeek Sparse Attention и контекст в 1 млн токенов. Вместе с базовыми весами опубликованы FP8-квантованная версия, пайплайн для файнтюнинга и набор инструментов для компрессии AngelSlim.
Отдельно стоит отметить то, что обычно остается за кадром. Зазор между выходом весов и возможностью их нормально обслуживать схлопнулся почти до нуля. SGLang получил поддержку Kimi K3 в день релиза, а в vLLM 0.28 приехали sparse MLA на декоде для DeepSeek V4, спекулятивное декодирование DSpark с приростом около 60% к TTFT и Decode Context Parallel для Kimi-K3 со слитыми ядрами FlashKDA — это примерно 17 ГиБ экономии памяти на каждом GPU. SGLang в версии 0.5.18 ускорил декод DeepSeek-V4-Pro на B200 с 320 до 169 микросекунд.
Еще год назад «подождать месяц, пока рантайм научится» было нормой — теперь на сроки пилота это влияет сильнее, чем очередные пять пунктов на бенчмарке. Единственное, о чем стоит знать заранее при обновлении: в vLLM 0.28 bitsandbytes вынесен в отдельный плагин, Transformers подняты до 5.15.0, а calculate_kv_scales и override_attention_dtype удалены. Тем показательнее, что узкое место все равно осталось — просто оно уже не в софте.
Первое — архитектурный сдвиг стал повсеместным. Разработчики начали массово отказываться от классического Attention на длинных текстах в пользу собственных гибридных алгоритмов. У Qwen это Gated DeltaNet, у Moonshot — Kimi Delta Attention, у GLM — сочетание линейного и разреженного внимания (с mHC и IndexPool), у Hunyuan — Gated DeepSeek Sparse Attention, а у NVIDIA Nemotron — Mamba-2 с MoE. Классические тяжелые подходы окончательно ушли из фронтира. Параллельно развивается экстремальная разреженность: у вышедшей [19] 26 августа Qwen3.8-Flash-Next активны всего 6 млрд параметров из 125 млрд, а слой n-gram эмбеддингов вынесен в системную RAM, а не в память GPU. Обучение этой модели, по заявлению Alibaba, обошлось в одну девятую от Qwen3.7-Plus.
Второе — лицензии начали расходиться. По данным [20] августовского отчета Hugging Face «State of Open Models: Summer 2026», среди китайских релизов крупнее 20B Apache 2.0 занимает 59%, MIT — 22%, некоммерческих ограничений почти нет. Среди американских релизов того же класса Apache/MIT — только 29%, кастомные условия — 41%, еще 30% выходят без внятной декларации. То есть в этом сегменте китайские открытые релизы формально свободнее американских. Но на самых крупных моделях — Qwen3.8-Max, Kimi K3 — впервые пошел откат к ограничительным условиям.
Третье — разрыв «скачали» и «запустили». По данным из того же отчета, модели меньше 1B дают 83% всех скачиваний за всю историю, модели крупнее 100B — 1%. Терабайтные веса — это витрина, а работает индустрия на мелочи. И только один репозиторий на платформе попадает одновременно в топ-25 по скачиваниям и в топ-25 по лайкам.
Четвертое — безопасность отстает от возможностей. Отчет [21] SaferAI от 4 августа: GLM-5.2 отстает от GPT-5.5 и Claude Opus 4.7 по кибер- и биовозможностям «всего на несколько месяцев», но не отказалась ни от одной протестированной наступательной задачи. Claude Opus 4.7 отказывалась настолько последовательно, что CyberGym на ней не удалось прогнать целиком.
10 августа Meta* выложила [22] Muse Glimmer: 30 млрд параметров, лицензия Apache 2.0. Это первый open-weights релиз компании со времен Llama 4 — спустя 16 месяцев закрытой политики.
Модель заточена под локальные always-on агентские сценарии, и вся ее инженерия — про то, чтобы влезть в бюджет памяти обычной машины:
гибридное внимание дает KV-кэш около 1,8 ГБ при полном контексте 128K;
квантизация K-Quant-Dynamic в 4 бита ужимает модель с 55+ ГБ до менее чем 20 ГБ при минимальной деградации на агентских задачах;
целевое железо — MacBook M4-Max/M5-Max и RTX 5090, бюджет памяти 24–32 ГБ;
спекулятивное декодирование DFlash ускоряет генерацию в 3,1 раза на RTX 5090, в 1,8 раза на M5 Max и в 1,5 раза на M4 Max.
Лицензия здесь важнее бенчмарков. Apache 2.0 — это отсутствие потолка по MAU и отсутствие acceptable-use оговорок, которые были во всех лицензиях Llama. Для продуктовых команд, которые упирались именно в юридические условия, а не в качество, это разблокировка.
Теперь про качество. Независимая оценка [23] Artificial Analysis: Intelligence Index 35 — на пять пунктов выше Gemma 4 31B при сопоставимом размере, но ниже Qwen3.6 27B с ее 38. На агентских задачах отставание заметнее: GDPval-AA v2 Elo 953 против 1 141 у Qwen3.6 27B, при том что человеческий baseline — 1 000. И отдельно неприятное: hallucination rate 82% против 49% у Qwen3.6 27B. Цифру стоит читать правильно — это метрика AA-Omniscience, где высокие значения нормальны для всего класса компактных моделей, а не «доля неверных ответов». Но разрыв в тридцать три пункта с моделью сопоставимого размера говорит ровно об одном: калибровка знаний у Muse Glimmer отстает от ее же уровня интеллекта [24]. Модель уверенно говорит то, чего не знает.
Отдельно стоит отметить, что Meta* не отдает модель через собственный API — только веса на Hugging Face и сторонние провайдеры. Интеграции сделаны с llama.cpp, MLX, ExecuTorch, Ollama, LM Studio, vLLM и SGLang.
Цукерберг приложил к выкладке эссе с призывом ослабить американские ограничения на обучающие данные для открытых моделей, сохранив при этом экспортный контроль на кремний. Ключевая формулировка: «Я не считаю, что ограничение доступа к иностранным open source моделям — эффективное решение. Наша цель должна быть в том, чтобы американские open source модели были лучшими в мире».
Финансовый фон у этого разворота специфический: capex Meta* на 2026 год — 130 млрд $, при этом свободный денежный поток за второй квартал упал на 91% год к году.
16 августа вступил в силу новый прайс [25] DeepSeek. Это первый случай, когда крупная лаборатория не снизила, а подняла цены на API — и заодно ввела тарификацию по времени суток.
Новая сетка (off-peak / peak, за миллион токенов):
|
Модель |
Input, cache hit |
Input, cache miss |
Output |
|
deepseek-v4-flash |
0,007$ / 0,014$ |
0,22$ / 0,44$ |
0,66$ / 1,32$ |
|
deepseek-v4-pro |
0,022$ / 0,044$ |
0,66$ / 1,32$ |
1,98$ / 3,96$ |
Контекст у всех моделей — 1M токенов, максимальный вывод до 384K. Относительно прежних [26] тарифов пиковая цена на output выросла на 371% для V4-Flash (с 0,28$ до 1,32$) и на 355% для V4-Pro (с 0,87$ до 3,96$). Но в off-peak рост куда скромнее — 136% и 127% соответственно, а по input он укладывается в диапазон 51–214%. Фигурирующие местами «+1 100%» относятся исключительно к cache-hit input, то есть к самой дешевой строке прайса. Сама DeepSeek формулирует изменение как «более рациональное распределение ресурсов», не комментируя причины прямо.
Чтобы оценить масштаб разворота, стоит вспомнить, с чего месяц начинался. 1 августа Axios писал [27] ровно противоположный сюжет: DeepSeek V4 Flash по 0,28$ за миллион выходных токенов против 25$ у Claude Opus 4.8 и 30$ у GPT-5.6 Sol — то есть дешевле примерно на 99%. Через две недели этот разрыв сократился впятеро.
И встречное движение с другой стороны: 21 августа OpenAI снизила [28] цены на GPT-5.6 Sol — input с 5$ до 4$ (минус 20%), output с 30$ до 20$ (минус 33%). Скидка действует три месяца, до 21 ноября, и распространяется на Fast mode, long-context, Batch и Flex.
Практический вывод для тех, кто считает юнит-экономику фичи: дельта между открытыми и проприетарными моделями перестала быть двумя порядками. Она все еще в пользу открытых, но теперь это разница в разы, а не в сто раз, — и на этой дистанции начинают весить накладные расходы на самостоятельное развертывание, о которых говорит раздел про память.
19 августа Anthropic перевела в стадию общего доступа сразу три вещи, которые до этого жили в превью, а 27-го показала спецификацию, выводящую агентов за пределы экрана
Главное изменение в Computer Use — агент теперь выполняет [29] несколько действий за один шаг вместо одного действия на вызов API. Это напрямую режет и латентность, и стоимость задачи. Отдельно: нагрузки под HIPAA теперь допустимы в рамках BAA.
Новый Browser Use tool читает структуру страницы вместе со скриншотами и целится в DOM-элементы, а не в пиксельные координаты. Для всех, кто хоть раз отлаживал агента, который промахивался мимо кнопки после смены разрешения, — это принципиальная разница.
Skills API — версионируемые «папки экспертизы», которые исполняются в песочнице кодового исполнения Anthropic, то есть хостить их не нужно. Files API дает хранение документов с автоистечением, пятикратно поднятые лимиты и 1 ТБ на организацию. Документы передаются по ID вместо повторной отправки в каждом запросе.
Расширение для Chrome вышло в общий доступ (GA) на всех платных тарифных планах. Оно поддерживает автономное выполнение действий — то есть работает без ручного подтверждения каждого шага, а безопасность транзакций валидируется через специальный safety-классификатор.
Anthropic также опубликовала [30] замеры успешности атак методом внедрения подсказок с включенными защитными проверками и классификатором. У моделей Sonnet 5, Opus 5 и Mythos 5 показатель успешности атак составил ровно 0%. У Fable 5 он равен 0,3%, а у прошлой Opus 4.5 — 16,7%. Последняя цифра наглядно иллюстрирует, насколько быстро разработчики закрывали эту уязвимость в течение последнего года.
27 августа вышел [31] предварительный исследовательский релиз стандарта MHS, который позволяет агентам обнаруживать лабораторные и производственные приборы и управлять ими через единый интерфейс. Базовые примитивы здесь — чтение и запись. Стандарт работает рядом с MCP, а не вместо него: MCP, CLI и code API остаются тремя механизмами управления, вместе дающими оркестрацию нескольких устройств одной командой.
Результаты у партнеров, которые уже интегрировались:
QuEra Computing: успешность relock лазера 99,3% против 58% на baseline, время relock — 6 секунд против 150;
Carnegie Mellon: интеграция прибора за 8 часов вместо недель;
University of Washington: подключение прибора менее чем за неделю вместо месяцев;
Tetsuwan Scientific: точность дозирования на 12–17% лучше заводской спецификации.
Безопасность реализована лимитами на уровне драйверов: в тестах заблокированы шесть индуцированных режимов отказа — отсутствующий планшет, повернутый планшет, занятый ридер, отключенная камера, недостижимое устройство и аварийный останов. Пока стандарт закрытый, open source обещан позже. Ждем.
Отчет за второй квартал 2027 финансового года, опубликованный 26 августа показал [32] выручку 96,2 млрд $ — плюс 106% год к году и плюс 18% квартал к кварталу. Ключевым драйвером по-прежнему считаются дата-центры — 89,0 млрд $, плюс 117% год к году. Валовая маржа 75,0%, EPS non-GAAP 2,22$ против ожиданий аналитиков в районе 2,06–2,09$.
Гайденс на третий квартал — 108,0 млрд $ ±2%. Примечательно, что в эти ожидания компания превентивно заложила нулевую выручку от поставок вычислительных систем для дата-центров в Китай. Параллельно NVIDIA продолжила агрессивный возврат капитала инвесторам: объем обратного выкупа акций за отчетный квартал составил около 19,7 млрд $.
Такой прогноз подкреплен запуском нового флагмана. Vera Rubin вышла в полномасштабное производство, стойки уже работают у CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud Infrastructure и Nebius.
17 августа объявили [33], что NVIDIA гарантирует до 105 млрд $ условных обязательств по лизинговым и энергетическим платежам под дата-центр OpenAI в центральном Огайо — на землях бывшего уранообогатительного комплекса.
Параметры: аренда на 20 лет, 8 IT-гигаватт вычислительной мощности, около 10 ГВт новой генерации (в том числе 9,2 ГВт газовой), 35 000 строительных рабочих мест и 2 500 постоянных. Первые мощности — с 2028 года. SB Energy строит и владеет объектом, NVIDIA вкладывает в нее дополнительно 1,5 млрд $.
Интереснее динамика самой цифры. В июле обсуждалась [34] гарантия до 250 млрд $, 14 августа она сжалась до «менее 120 млрд $», 17 августа — до 105 млрд $. То есть на 145 млрд $ ниже первых сообщений.
На публикации о 250 млрд $ акции NVIDIA внутри дня падали на 4,5% — рынок читал схему как круговое финансирование. Вендор финансирует инфраструктуру, которая создает спрос на его же чипы.
Были и сообщения [35] о сделке более чем на 7 млрд $. Для контекста: в мае OpenRouter привлек 113 млн $ Series B при оценке около 1,3 млрд $, то есть оценка выросла более чем впятеро за три месяца. Метрики платформы — 8 млн пользователей и доступ к более чем 400 моделям.
Логика [36] покупателя простая. Слой маршрутизации между моделями перестал быть удобной оберткой и стал инфраструктурой, через которую проходит трафик и биллинг. Роутер — это место, где считаются деньги, а Stripe как раз про это.

ТехноДень — 8 октября
Флагманская конференция про технологии и бизнес. 20+ докладов, воркшопов и дискуссий, 20 интерактивных стендов, мерч и афтепати. Участие бесплатное: нужна только регистрация.
Зарегистрироваться → [37]
Обязательства для провайдеров крупных моделей формально действовали с августа 2025 года, но без полномочий Еврокомиссии по принуждению — а теперь она начала их реально применять [38]: запрашивать документацию, оценивать модели и штрафовать. Максимальный штраф — до 15 млн € или 3% мирового оборота компании, смотря что больше. Заодно заработало требование маркировать ИИ-контент не просто плашкой на экране, а меткой, которую можно распознать программно — то есть чат-бот обязан сообщать, что он бот, а сгенерированная картинка должна нести технический след своего происхождения. Системы высокого риска (найм, образование, кредитный скоринг) при этом получили отсрочку до конца 2027 года — их пока решили не трогать.
В России в это же время в Госдуму внесли [39] похожий по духу законопроект — поправку к ФЗ №243-ФЗ, которая превращает маркировку ИИ-контента из права в обязанность владельцев крупных моделей, с вступлением в силу 1 марта 2027 года. Уязвимость та же, что и в европейской версии: видимый водяной знак стирается редактированием, а метаданные теряются при конвертации файла, так что многое будет держаться на добросовестности крупных площадок, а не на технической защите.
На рынке тем временем случилась куда более масштабная перемена. За первое полугодие 2026-го российские компании прогнали через китайские модели — в первую очередь Qwen, GLM и Kimi — больше токенов, чем за весь 2025 год, в 11 раз. При этом само железо под запуск моделей подорожало почти втрое: минимальный комплект серверов с GPU для развертывания одной модели обходился в 13,7 млн рублей в 2025 году, а теперь — 38,8 млн.
А вот с внедрением все не так гладко, как с закупкой моделей. Исследование [40] «Инфосистемы Джет» показало: 86% крупных российских компаний уже пробуют LLM, но по-настоящему в промышленной эксплуатации — только половина из них. С ИИ-агентами разрыв еще резче: проекты есть почти у 60% компаний, а в реальном проде работают лишь 15%. Главные тормоза — дороговизна серверов и юридические риски, и почти половина компаний пока не видит от ИИ устойчивого экономического эффекта. Проще говоря: модели скачивать научились быстро, а довести их до продакшена — заметно дольше, чем казалось в начале года.
Август зафиксировал смену дефицита: узким местом стала память — и это надолго. Контракты на HBM у корейских вендоров расписаны до конца 2026 года, часть тянется до 2030-го, а гибридное соединение отложено до HBM5, то есть до 2029–2030 годов. Ждать удешевления памяти в ближайшие полтора года неоткуда — а значит, и цена инференса больше не будет падать сама собой. Разворот DeepSeek в этой логике — первый случай, который просто случился раньше остальных.
Отсюда два следствия. Гонка моделей сместится с размера на эффективность: линейное и разреженное внимание, сжатие KV-кэша и экстремальная разреженность вроде 6 млрд активных параметров из 125 у Qwen3.8-Flash-Next перестают быть исследовательскими приемами и становятся условием, при котором модель вообще имеет смысл разворачивать.
И второе, менее очевидное: преимущество получит не тот, кто выбрал правильную модель, а тот, кто умеет ее эксплуатировать. Веса теперь есть у всех и почти бесплатно — а вот 38,8 млн рублей на минимальный комплект серверов и инженеры, которые доведут пилот до прода, есть далеко не у всех. Именно здесь в ближайший год и разойдутся те, кто получает от ИИ эффект, и те, кто продолжает считать пилоты.
А как август повлиял на ваши планы по железу и бюджету на инференс — пересматриваете ли вы расчеты после подорожания памяти и разворота цен на API? Делитесь опытом [41] в комментариях.
*Признана в России экстремистской организацией, а ее деятельность запрещена на территории страны решением Тверского районного суда Москвы от 21 марта 2022 года.
Автор: techno_mot
Источник [42]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/34945
URLs in this post:
[1] ИИ-инфраструктуры: https://promo.selectel.ru/support_ai_projects/?utm_source=habr.com&utm_medium=referral&utm_campaign=supportaiprojects_article_mldigestaugust26_010926_content
[2] память: http://www.braintools.ru/article/4140
[3] заявленные: https://www.servethehome.com/nvidia-vera-rubin-nvl72-rack-at-hot-chips-2026/
[4] обучении: http://www.braintools.ru/article/5125
[5] ответила: https://www.servethehome.com/amd-helios-mi400-system-architecture-at-hot-chips-2026/
[6] интересное: https://www.servethehome.com/googles-tpuv8s-for-training-and-inference-at-hot-chips-2026/
[7] Эволюция: http://www.braintools.ru/article/7702
[8] показала: https://www.servethehome.com/metas-mtia-custom-ai-silicon-at-hot-chips-2026/
[9] Запустить ИИ‑роутер →: https://promo.selectel.ru/ai-router/?utm_source=habr.com&utm_medium=referral&utm_campaign=airouter_article_mldigestaugust26_010926_banner_ord
[10] Micron: https://www.tomshardware.com/tech-industry/semiconductors/micron-says-the-silicon-gap-between-hbm-and-ddr5-is-widening-with-every-generation
[11] добавила: https://www.tomshardware.com/tech-industry/semiconductors/sk-hynix-says-hybrid-bonding-wont-be-ready-for-hbm4e-as-ai-memory-runs-into-a-775-micron-ceiling
[12] ретранслировала: https://www.trendforce.com/news/2026/08/13/news-samsung-sk-hynixs-hbm4-push-puts-hbm-general-memory-pricing-in-the-spotlight-for-2h-earnings/
[13] открыли: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
[14] Вышла: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
[15] Z.ai: http://Z.ai
[16] выложила: https://huggingface.co/zai-org/GLM-5.3-Flash
[17] внимания: http://www.braintools.ru/article/7595
[18] выложила: https://huggingface.co/tencent/Hy4-preview
[19] вышедшей: https://huggingface.co/Qwen/Qwen3.8-Flash-Next
[20] По данным: https://huggingface.co/blog/state-of-open-models-summer-2026
[21] Отчет: https://techcrunch.com/2026/08/04/open-weight-ai-models-are-catching-up-to-the-frontier-the-safety-gap-remains/
[22] выложила: https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
[23] оценка: https://artificialanalysis.ai/articles/muse-glimmer
[24] интеллекта: http://www.braintools.ru/article/7605
[25] новый прайс: https://api-docs.deepseek.com/quick_start/pricing
[26] прежних: https://api-docs.deepseek.com/updates/
[27] писал: https://www.axios.com/2026/08/01/deepseek-model-cheap-ai-price-war
[28] снизила: https://community.openai.com/t/20-price-reduction-for-gpt-5-6-sol-api-codex-credits-and-chatgpt-work/1391726
[29] выполняет: https://claude.com/blog/computer-use-skills-api-files-api
[30] опубликовала: https://claude.com/blog/claude-in-chrome-generally-available
[31] вышел: https://www.anthropic.com/news/model-hardware-standard-research-preview
[32] показал: https://nvidianews.nvidia.com/news/nvidia-announces-financial-results-for-second-quarter-fiscal-2027
[33] объявили: https://www.cnbc.com/2026/08/17/nvidia-financing-open-ai-data-center-ohio.html
[34] обсуждалась: https://fortune.com/2026/08/18/openai-data-center-deal-with-nvidia-comes-in-145-billion-lower-than-reportedsignaling-concerns-of-artificial-demand-for-chips/
[35] сообщения: https://techcrunch.com/2026/08/16/stripe-will-reportedly-acquire-ai-gateway-startup-openrouter-for-7b/
[36] Логика: http://www.braintools.ru/article/7640
[37] Зарегистрироваться →: https://techday.selectel.ru/?utm_source=habr.com&utm_medium=referral&utm_campaign=techday_article_mldigestaugust26_010926_banner_ord
[38] применять: https://digital-strategy.ec.europa.eu/en/news/commission-starts-enforcing-ai-act-rules-and-new-transparency-requirements-2-august
[39] внесли: https://www.comnews.ru/content/246954/2026-08-19/2026-w34/1008/gosduma-rf-pometit-kontent
[40] Исследование: https://www.cnews.ru/news/line/2026-08-26_issledovanie_infosistemy
[41] опытом: http://www.braintools.ru/article/6952
[42] Источник: https://habr.com/ru/companies/selectel/articles/1076524/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1076524
Нажмите здесь для печати.