Kimi K3 — что реально даёт открытие весов самой большой модели. kimi.. kimi. Kimi K3.. kimi. Kimi K3. llm.. kimi. Kimi K3. llm. moe.. kimi. Kimi K3. llm. moe. Moonshot AI.. kimi. Kimi K3. llm. moe. Moonshot AI. Open source.. kimi. Kimi K3. llm. moe. Moonshot AI. Open source. искусственный интеллект.. kimi. Kimi K3. llm. moe. Moonshot AI. Open source. искусственный интеллект. Машинное обучение.. kimi. Kimi K3. llm. moe. Moonshot AI. Open source. искусственный интеллект. Машинное обучение. Открытые данные.
Kimi K3 — что реально даёт открытие весов самой большой модели - 1

27 июля Moonshot AI выложила веса Kimi K3 — модели на 2,8 трлн параметров, которая до этого работала только через платный API. Вместе с весами открыли технический отчёт и три внутренних инструмента, на которых модель обучали.

Разберём релиз по частям: что подтверждено независимыми замерами, что остаётся заявлением компании и на какие детали стоит посмотреть до того, как планировать внедрение.

TL;DR

  • 2,8 трлн параметров, MoE: на каждый токен работают 16 экспертов из 896, это около 50 млрд активных параметров. Контекст — 1 млн токенов, зрение встроено без отдельного модуля.

  • 57 баллов в индексе Artificial Analysis — четвёртое место, уровень Opus 4.8 и GPT-5.5. Среди открытых моделей это лучший результат: GLM-5.2 — 51, DeepSeek V4 Pro — 44.

  • Первое место на LMArena Frontend Code Arena и 76% побед над Claude Fable 5 в слепых сравнениях по фронтенду. Арена узкая, на общий интеллект это не переносится.

  • Заявленный прирост эффективности в 2,5 раза против K2 — цифра из технического отчёта Moonshot, независимо пока не перепроверена.

  • Веса занимают около 1,4 ТБ даже в MXFP4. «Скачать и запустить дома» не выйдет.

  • Лицензия своя, не Modified MIT, как у прошлых моделей: есть порог по выручке и требование показывать бренд в интерфейсе на большом масштабе.

  • Отдельно открыли FlashKDA, MoonEP и AgentENV — куски обучающей инфраструктуры, которые обычно наружу не выходят.

16 экспертов из 896

Kimi K3 устроена как разреженная MoE‑модель. Полный размер — 2,8 трлн параметров, но на обработку одного токена включается только 16 из 896 экспертов, примерно 50 млрд параметров живого вычисления. Схема даёт большую ёмкость знаний при относительно скромной стоимости шага генерации.

В основе — два архитектурных решения: Kimi Delta Attention и Attention Residuals. Первое меняет способ работы с длинной последовательностью, второе — то, как информация проходит через глубину сети. Полностью softmax‑внимание в модели больше не используется: часть слоёв в каждом блоке заменена на KDA.

Здесь начинается первая оговорка. Moonshot заявляет, что архитектура вместе с новым рецептом обучения даёт около 2,5-кратного прироста эффективности масштабирования против K2 — “больше интеллекта на единицу вычислений”. Цифра взята из собственного технического отчёта компании. Отчёт подробный и с методикой, но это внутренний замер, а не независимая проверка.

Что показали независимые замеры

В индексе Artificial Analysis Kimi K3 набрала 57 баллов. Это четвёртое место в общем зачёте и первое среди моделей с открытыми весами.

Как выглядит расстановка:

  • позади Claude Fable 5 и GPT-5.6 Sol;

  • на уровне Claude Opus 4.8 и GPT-5.5;

  • заметно выше открытых конкурентов: GLM-5.2 — 51, DeepSeek V4 Pro — 44.

На агентных задачах прогресс поколения виден яснее всего: в GDPval v2 рейтинг Elo вырос с 1190 у K2.6 до 1668. Отдельная витрина — LMArena Frontend Code Arena, где Kimi K3 заняла первое место, а в слепых парных сравнениях по фронтенду выиграла у Claude Fable 5 в 76% случаев.

Последнюю цифру стоит читать аккуратно. Frontend Code Arena — узкая площадка с конкретным типом задач и субъективной оценкой результата разработчиками. Победа там означает сильный фронтенд‑код, но не общее превосходство над Fable 5; сводный индекс это подтверждает.

Kimi K3 — что реально даёт открытие весов самой большой модели - 2

1,4 терабайта, о которые всё упирается

Главное практическое ограничение релиза не в качестве модели. Веса Kimi K3 занимают порядка 1,4 ТБ, и это уже в формате MXFP4 — четырёхбитном представлении, которое сжимает модель по сравнению с исходной точностью.

Развернуть такое на рабочей станции нельзя. Речь про многокарточные серверные конфигурации, и сообщения в духе «запустил фронтир‑модель на домашнем железе» пока стоит проверять на предмет того, что именно там запускалось.

Поэтому реальный путь для большинства команд — арендованные мощности. День запуска Moonshot закрыла плотно: поддержку заявили Together AI, Fireworks, DigitalOcean, Nebius Token Factory, Baseten и Modal, а vLLM выкатил оптимизированный инференс в день релиза. По API модель стоит 3 доллара за миллион входных токенов и 15 за миллион выходных, кэшированный вход — 30 центов.

Для сравнения экономики: по расчёту Artificial Analysis полный прогон их индекса обходится в среднем в 0,94 доллара за задачу против 1,04 у GPT-5.6 Sol и 1,80 у Claude Opus 4.8.

Лицензия: свободно до определённого порога

Формулировку «открытые веса» тут стоит уточнить, и это самая недооценённая часть релиза.

Прошлые модели семейства Kimi выходили под Modified MIT. Для K3 Moonshot написала собственную лицензию. Скачивание, дообучение и использование свободны, обязательное условие — сохранять исходный текст лицензии.

Ограничения включаются на масштабе:

  • продукт с аудиторией свыше 100 млн активных пользователей в месяц или выручкой больше 20 млн долларов в месяц обязан показывать «Kimi K3» в интерфейсе;

  • отдельный пункт написан под провайдеров, которые перепродают модель как сервис: им нужно отдельное соглашение с Moonshot.

Для исследователей, стартапов и внутренних корпоративных внедрений это ничего не меняет. Пункт написан под облачные платформы, которые захотят зарабатывать на модели. Но если планируется публичный продукт с расчётом на рост, текст лицензии нужно прочитать целиком до начала интеграции, а не после.

Инфраструктура, которую обычно не отдают

Помимо весов Moonshot открыла три компонента стека:

  • FlashKDA — CUDA‑ядра на CUTLASS под Kimi Delta Attention. Заявленное ускорение обработки входного контекста — в 1,72–2,22 раза относительно flash‑linear‑attention на GPU H20. Это бенчмарк производителя на конкретном железе, на других картах цифры будут другими. Проект был открыт ещё в апреле.

  • MoonEP — библиотека обмена данными между экспертами MoE при распределённом обучении.

  • AgentENV — платформа изолированных песочниц на Firecracker microVM, сделанная вместе с kvcache‑ai. Умеет дешёвые снапшоты, паузу и ветвление окружений, что нужно для обучения агентов с подкреплением в промышленных объёмах.

AgentENV интереснее самой модели с точки зрения того, что вообще редко выходит наружу. Обученные веса выкладывают многие, а инфраструктуру, в которой агентов гоняют тысячами параллельных сессий с возможностью откатить окружение, лаборатории обычно держат при себе.

На что смотреть в ближайшие месяцы

Короткий список того, по чему можно будет судить о реальном эффекте релиза:

  1. Квантизация от сообщества. Если K3 удастся ужать до одной восьмикарточной ноды без заметной потери качества, круг тех, кто может её развернуть, вырастает на порядок. Если нет — открытость остаётся преимуществом для тех, у кого уже есть стойка.

  2. Независимое воспроизведение 2,5×. Пока это цифра из отчёта. Внешние замеры на сопоставимых бюджетах покажут, насколько KDA действительно меняет экономику обучения.

  3. Ответ GLM и DeepSeek. Разрыв в 6 и 13 баллов индекса — не пропасть, и оба конкурента работают в том же цикле выпусков.

  4. Практика по лицензии. Как поведут себя MaaS‑провайдеры и станет ли отдельное соглашение с Moonshot стандартной процедурой.

Отдельный сценарий для команд с ограничениями по передаче данных: открытые веса снимают вопрос, который API не решал ни за какие деньги. Модель в собственном контуре не отправляет запросы на внешние серверы, и обсуждение трансграничной передачи данных на этом заканчивается. Ценой в 1,4 ТБ и стойку под неё.


Отсюда главный вопрос к читателям. Открытые веса, которые физически может развернуть пара сотен организаций в мире, — это про доступность или про репутацию и давление на цены закрытых API? И если вы уже гоняли K3 через API или у провайдеров: как она держится на длинном контексте ближе к верхней границе миллиона токенов и совпадают ли впечатления по фронтенд‑коду с результатами арены?

Ссылки по теме

Источник: Технический отчёт Kimi K3 — Moonshot AI.

Автор: stas-clear

Источник