- BrainTools - https://www.braintools.ru -

Пока весь топ-5 OpenRouter забирают китайские модели, Hy3, MiMo, DeepSeek V4 Flash, MiniMax M3 и GLM-5.2, платформа гоняет по 60 триллионов токенов в неделю. Логика [1] пользователей при этом простая: сложно сравнивать бенчмарки, легко сравнивать счета.
Moonshot AI выложила Kimi K3 [2], и это самая большая open weight модель в истории: 2.8 триллиона параметров, миллион токенов контекста. Веса обещают 27 июля, а пока доступ через API по цене $3/$15, ровно как у Sonnet 5. Artificial Analysis намерила 57 по Intelligence Index (сводный балл интеллекта [3]): выше, чем Opus 4.8 (56), ниже, чем Fable 5 (60) и GPT-5.6 Sol (59). На Frontend Code Arena [4], где люди вслепую сравнивают сгенерированные интерфейсы, K3 встала на первое место с 1679 очками, обойдя и Fable 5, и GPT-5.6 Sol. Впервые Китай возглавил этот лидерборд.

Архитектурно интереснее всего Kimi Delta Attention: механизм, который держит фиксированную обученную память [5] на каждый запрос вместо того, чтобы честно пересчитывать всё внимание [6] по миллионному контексту. Отсюда обещанные до 6× по скорости декодинга на длинных контекстах и цена, которая почти не растёт с длиной. Стоимость решённой задачи Artificial Analysis оценила в $0.94 против $1.80 у Opus 4.8. Модель выигрывает Program Bench и SWE Marathon, то есть держит длинные многочасовые сессии, а не только короткие задачки.
Сама Moonshot признаёт заметный разрыв в пользовательском опыте [7] с Fable 5 и GPT-5.6 Sol. Уровень галлюцинаций на AA-Omniscience подрос до 51% с 39% у прошлой K2.6, модель многословная, медленная (около 28 токенов в секунду через API) и живёт на постоянном режиме max thinking. И open weight не значит “дёшево запустить”: 2.8T даже в 4-битной упаковке весит около 1.4 ТБ, Moonshot советует ставить от 64 ускорителей. Домашний ноутбук с 24 ГБ выдаст, как шутят на реддите, “0.01 токена в секунду”. А 19 июля Moonshot приостановила новые подписки на Kimi: за 48 часов спрос на K3 подошёл к пределу их мощностей, и новые места обещают открывать партиями по мере добавления GPU.

Thinking Machines, лаборатория Миры Мурати (бывшего технического директора OpenAI), выпустила первую собственную модель Inkling [8]: MoE (смесь экспертов) на 975 миллиардов параметров, 41 миллиард активных, лицензия Apache 2.0, миллион токенов контекста, обучена на 45 триллионах мультимодальных токенов текста, картинок, аудио и видео. Рядом идёт превью Inkling-Small на 276B (12B активных), который на многих бенчмарках догоняет старшего брата.

Ставка у Мурати на кастомизацию: солидная база open weight, которую тюнят под себя через их же платформу Tinker. Архитектура необычная, вместо привычного RoPE тут относительное позиционное смещение плюс короткие свёртки вокруг внимания. ARC Prize подтвердил [9], что Inkling теперь лучшая open weight модель на ARC-AGI (тест на абстрактное рассуждение): 79.5% на первой версии и 36.5% на второй. В комьюнити её назвали сильнейшим американским open weight релизом, тут же добавив, что по агентным задачам она всё равно позади GLM-5.2 и Kimi.
Китайские модели тем временем забрали весь топ-5 OpenRouter по расходу токенов: Hy3 от Tencent, MiMo от Xiaomi, DeepSeek V4 Flash, MiniMax M3 и GLM-5.2. OpenAI и Google из топ-10 просто исчезли, а Claude держится в самом хвосте десятки, на 8-10 местах (единственная не-китайская модель выше, Nemotron от NVIDIA, стоит на 6-м). Платформа гоняет около 60 триллионов токенов в неделю, и логика у пользователей простая: “сложно сравнивать бенчмарки, легко сравнивать счета”. Financial Times пишет, что компании массово переходят на китайские open weight модели ради экономии. Сатья Наделла, глава Microsoft, подбросил аргумент с другой стороны: за облачный интеллект платишь дважды [10], деньгами и собственными данными, которые скармливаешь чужой модели, чтобы она стала полезной.

Пока рынок переходит на дешёвые китайские веса, у Anthropic ровно обратная забота: кому вообще давать доступ к своей премиум-модели. На неделе она наконец закрыла тянувшуюся сагу с Fable 5. Разбирал её [11] две недели подряд: доступ то давали, то отбирали, дедлайн двигали трижды. Всю прошлую неделю реддит бурлил. Подписчики за $200 в месяц жаловались, что после дедлайна теряют доступ к лучшей модели компании, всплыла оценка, что на подписки приходится меньше 5% выручки Anthropic, а мягкие лимиты трат показали характер: у одного пользователя лимит в €2 превратился в счёт на €13.79, потому что модель “дописывает начатый ход” и списывает уже после превышения. 18 июля Anthropic объявила финал: с 20 июля Fable 5 включают во все планы Max и Team Premium с лимитом 50% недельной квоты, а Pro и Team Standard получают доступ через кредиты на использование плюс разовые $100. Формулировка в анонсе честная до трогательности: предсказать спрос на Fable “оказалось сложно”.

OpenAI на том же фоне просто растёт. Codex вырос в 10 раз за полгода [12], а после релиза GPT-5.6 счётчик и вовсе понесло: 6 миллионов пользователей 12 июля, 7 миллионов на следующий день, 8 миллионов ещё через сутки. 16 июля продуктовый лид Codex Тибо Соттьо отчитался о 9 миллионах и тут же в очередной раз сбросил недельный лимит, посоветовав подписчикам закрыть твиттер и заняться делом. Сэм Альтман называл спрос “безумным”, а лимиты команда сбрасывала снова и снова.
Цифры учитывают Codex и ChatGPT Work вместе. У Claude Code последняя публичная цифра февральская [13], около 2 миллионов. Поэтому разговоры о том, что “Codex обошёл Claude Code”, пока скорее нарратив, чем измерение: свежих сопоставимых цифр по Claude Code Anthropic просто не публиковала.
Лучший аргумент за то, чтобы держать код у себя, на неделе выдала сама xAI. Grok Build, консольный агент, который вышел вместе с Grok 4.5 как ответ на Claude Code и Cursor, поймали на выгрузке всего репозитория целиком. По разбору [14] International Cyber Digest, агент пакует всё дерево файлов и Git-историю в Google-бакет, далеко за пределами того, что нужно для самой задачи: на 12-гигабайтном репозитории утекло 5.1 ГБ, секреты уходили без всякой фильтрации. Выгрузку по-тихому прикрыли серверным флагом, а тумблер “улучшать модель” на неё не влиял. В xAI ответили [15], что при включённом zero data retention данные не хранятся, и добавили команду /privacy, которая отключает хранение и удаляет уже синхронизированное.

PrismML выпустила Bonsai 27B [16]: версию Qwen 3.6 27B, сжатую с 54 ГБ до 3.9 ГБ через однобитные веса. Это первая модель такого класса, которая влезает в айфон (iPhone 17 Pro), лицензия Apache 2.0. Вот приложение для iOS [17]. По их замерам, однобитная упаковка держит около 90% качества fp16. CNBC пишет [18], что Apple уже щупает технологию для Siri: 10-15× меньше памяти, 6-8× быстрее, 3-6× меньше энергии.
На реддите быстро уточнили, что “90% на бенчмарках” на реальных задачах ощущается ближе к очень низкобитному кванту: лучше Q2, хуже Q4, с галлюцинациями и залипаниями при вызове инструментов. Телефону всё равно приходится считать все 27 миллиардов параметров: память сэкономили, но упёрлись в батарею. В демо айфон терял пару процентов заряда меньше чем за минуту.
Над всей этой волной open weight моделей навис вопрос регулирования. Демис Хассабис, глава Google DeepMind, опубликовал редкое эссе [19]: AGI, по его прикидке, “всего в паре лет”, а мы стоим “в предгорьях сингулярности”. Практическое предложение конкретное: создать в США орган стандартов по образцу FINRA (саморегулятор Уолл-стрит), куда флагманские лаборатории сначала добровольно сдают модели на проверку, а потом это становится обязательным для выхода на рынок. Правила распространялись бы на все передовые модели, хоть open weight, хоть закрытые, хоть иностранные, а стартапы и академические проекты не трогали бы. Ирония в том, что пока Хассабис публично зовёт к стандартам и надзору, внутри DeepMind исследователь уволился [20] из-за военных контрактов лаборатории и отсутствия ограничений на автономное оружие и массовую слежку.
Perplexity показала SPACE [21], собственную песочницу, через которую проходит 100% боевого трафика их агента Computer. Каждая задача крутится в отдельной одноразовой Firecracker-микроВМ (изолированная мини-виртуалка, которая стартует за миллисекунды), а постоянно обновляемые снапшоты позволяют ставить сессию на паузу и продолжать с того же места. Медианное время создания песочницы упало со 185 до 60 мс. Скучная на вид инфраструктура, от которой напрямую зависит, потянет агент многочасовую задачу или сорвётся.
Кстати, недавно я рассказывал про то, чем на самом деле различаются кодинг-агенты вроде Codex, Claude Code, OpenCode и Pi. Разобрал их изнутри по исходникам. Если тема зашла — почитайте [22].
Оставайтесь любопытными.
Пишу об искусственном интеллекте, языковых моделях и инструментах для разработчиков. Тестирую модели и сервисы на реальных задачах, а выводами делюсь в телеграм-канале [23].
Автор: xonika9
Источник [24]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/33312
URLs in this post:
[1] Логика: http://www.braintools.ru/article/7640
[2] Kimi K3: https://www.kimi.com/blog/kimi-k3
[3] интеллекта: http://www.braintools.ru/article/7605
[4] Frontend Code Arena: https://x.com/arena/status/2077824029126504525
[5] память: http://www.braintools.ru/article/4140
[6] внимание: http://www.braintools.ru/article/7595
[7] опыте: http://www.braintools.ru/article/6952
[8] Inkling: https://thinkingmachines.ai/news/introducing-inkling/
[9] подтвердил: https://x.com/arcprize/status/2078141332938523032
[10] платишь дважды: https://techcrunch.com/2026/07/13/satya-nadella-has-issued-a-shocking-warning-to-companies-using-ai/
[11] Разбирал её: https://gotacat.dev/blog/weekly-ai-hallucinations-grok-4-5-muse-spark-gpt-5-6-sol
[12] вырос в 10 раз за полгода: https://www.latent.space/p/ainews-codex-usage-up-10x-in-6-months
[13] февральская: https://www.anthropic.com/news/anthropic-raises-30-billion-series-g-funding-380-billion-post-money-valuation
[14] разбору: https://x.com/IntCyberDigest/status/2076689215258014069
[15] ответили: https://x.com/SpaceXAI/status/2076692402442846289
[16] Bonsai 27B: https://prismml.com/news/bonsai-27b
[17] приложение для iOS: https://apps.apple.com/us/app/atomic-chat-private-local-ai/id6761720226
[18] CNBC пишет: https://www.cnbc.com/2026/07/14/apple-prismml-ai-compression-iphone.html
[19] эссе: https://x.com/demishassabis/status/2076957440109625718
[20] уволился: https://x.com/Turn_Trout/status/2077448610157891734
[21] SPACE: https://x.com/perplexity_ai/status/2077432518081744979
[22] почитайте: https://habr.com/ru/articles/1060250/
[23] телеграм-канале: https://t.me/+kF3SiUZaW-RjOTgy
[24] Источник: https://habr.com/ru/news/1061066/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1061066
Нажмите здесь для печати.