- BrainTools - https://www.braintools.ru -
3 сентября 2026 года Institute of Foundation Models (IFM, подразделение MBZUAI) выкатил зоопарк из шести открытых моделей K2 Horizon размером от 0.9B до 375B параметров.
Технически самой интересной из них оказалась средняя модель, K2-Horizon-MoVA-36B-A4B [1]: 36 млрд параметров, из которых на каждый токен работает только около 4 млрд. Формально это MoE-модель, но авторы добавили в нее второй слой разреженности прямо в attention слои и назвали это MoVA, Mixture-of-Value Attention.
В классическом трансформере каждый блок состоит из attention-слоя и FFN (feed-forward network). FFN, как правило, самая тяжелая по параметрам часть блока, и именно ее обычно “разрежают” в духе Mixture-of-Experts:
вместо одного большого FFN держат пул из N экспертов (тоже FFN, но поменьше)
router (обычно линейный слой + softmax/sigmoid) для каждого токена решает, какие top-k экспертов из N активировать
выход модели считается как взвешенная сумма выходов выбранных экспертов
часто добавляют один или несколько shared experts, которые активны всегда, чтобы не терять “общие” знания при разреженной маршрутизации
Модель хранит гигантскую суммарную емкость (сотни миллиардов параметров), а для каждого токена вычисляет намного меньше. Это и есть источник разницы между “total params” и “active params” в карточках современных open-weight моделей (DeepSeek-V3, Qwen3-MoE, Nemotron и т.д.).
Вся эта разреженность в классическом MoE живет только в FFN. Attention остается плотными Q/K/V-проекциями, и сам механизм внимания [2] считается целиком для каждого токена.
MoVA берет ту же самую идею: router + top-k из пула экспертов + взвешенное объединение, и переносит ее внутрь attention, точнее в вычисление value-проекций [1 [3]].
Логика [4] следующая:
Q и K считаются как обычно (плотно) для корректного скалярного произведения при вычислении внимания.
V (value) превращается в MoE: вместо одной value-проекции на голову внимания есть пул value-экспертов, а per-token router выбирает top-k из них.
По независимому разбору реализации (наследуется от модульной архитектуры Qwen3MoE) в K2-Horizon-MoVA-36B-A4B используется сигмоидный роутер в attention, с post-gate через softplus, а не привычный softmax-top-k, как в FFN-роутерах.
Разреженность в value-пространстве совместима с FlashAttention и GQA, т.е. это не отдельный медленный механизм сбоку, а встроенная операция.
Идея в том, что value-проекция отвечает на вопрос: “какую информацию нести дальше по остаточному потоку”, и она может быть куда более контекстно-специфичной, чем единая на всех токенов проекция.
Раз FFN выигрывает от специализации через MoE, логично предположить, что value-пространство внимания тоже может выиграть от такой же специализации. При этом Q/K, отвечающие за “куда смотреть”, остаются едиными и стабильными.
Формально в самой K2-Horizon-MoVA-36B-A4B это выглядит так:
|
Параметр |
Значение |
|---|---|
|
Архитектура |
|
|
Всего параметров |
~36 млрд (37.44B с учетом эмбеддингов) |
|
Активных параметров на токен |
~4 млрд (5.95B по расчету vLLM Recipes с эмбеддингами) |
|
Слоев |
48 (3 “ведущих” плотных + 45 MoE-слоев) |
|
Hidden size |
2560 |
|
MoE в FFN |
100 маршрутизируемых экспертов, top-8 активных + 1 shared expert на слой |
|
MoVA в attention |
64 value-эксперта, top-4 активных на слой внимания, sigmoid-роутер + softplus post-gate |
|
Контекст |
512K (524 288 токенов) |
|
Эмбеддинги |
не разделяют веса (отдельные input/output) |
|
Точность весов |
BF16 |
|
Лицензия |
Apache 2.0 |
Иными словами, у модели два независимых уровня разреженности одновременно: MoE в FFN (как у всех), и MoVA в value-проекциях attention (это и есть архитектурная новизна релиза).
|
|
MoE (классический) |
MoVA |
|---|---|---|
|
Где разрежают |
Feed-forward сеть (FFN) |
Value-проекции внутри attention |
|
Что маршрутизируется |
Целые FFN-блоки (эксперты-сети) |
Value-эксперты в каждой голове/слое внимания |
|
Router |
Обычно softmax + top-k, часто с shared expert |
Sigmoid-роутер + softplus post-gate (в K2-Horizon) |
|
Совместимость с оптимизациями |
Стандартная (влияет только на FFN) |
Спроектирована как совместимая с FlashAttention и GQA |
|
Что остается плотным |
Attention целиком |
Q/K-проекции и сам softmax внимания |
|
Цель |
Увеличить емкость FFN без роста compute |
Увеличить емкость value-пространства attention без роста compute |
|
Где встречается |
DeepSeek-V3, Qwen3-MoE, Mixtral, Nemotron и др. |
Пока только в K2-Horizon-MoVA-36B-A4B (IFM) |
MoVA не заменяет MoE, а дополняет его дополнительным уровнем разреженности. В K2-Horizon-MoVA-36B-A4B они работают вместе: 100 экспертов в FFN (top-8+1) и 64 value-эксперта в attention (top-4). Итоговая цифра активных параметров (4B) складывается из обоих механизмов.
VRAM-ограничение задается суммарными весами (36B нужно держать в памяти [5] целиком), а не активными (4B), MoVA не облегчает требования к памяти сильнее, чем обычный MoE такого же размера. Выигрыш исключительно в вычислительной эффективности (FLOPs/токен) и, как следствие, в скорости и стоимости инференса при том же объеме VRAM/RAM.
IFM не опубликовала отдельную научную статью с описанием MoVA, механизм представлен только в блог-посте и в коде модели. Но сама идея переноса MoE-роутинга в attention далеко не новая, и на arXiv есть несколько прямых предшественников, которые почти дословно описывают то же самое, что делает MoVA.
Ближе всего по конструкции SwitchHead [2 [6]]. Это MoE-механизм для attention, в котором именно value- и output-проекции параметризуются через пул экспертов, а query и key считаются как обычно, т.е. ровно та же схема, что описана в карточке K2-Horizon.
Более того, авторы SwitchHead явно указывают, что использовали несостязательную (non-competitive) сигмоидную активацию для роутера вместо softmax, и что это позволило обучать модель без дополнительных регуляризаторов балансировки, и это же сочетание (sigmoid-роутер) фигурирует и в описании MoVA.
SwitchHead в оригинальной статье достигает того же perplexity, что и baseline-трансформер, и его можно комбинировать с MoE-FFN в единую архитектуру “SwitchAll” (то же самое двухуровневое разрежение, которое IFM использует в K2-Horizon-MoVA-36B-A4B).
Идею с MoE-слоями и в attention, и в FFN одновременно, но в архитектуре Universal Transformer, развивает MoEUT [3 [7]] и там прямо описывается, что “SwitchHead параметризует value- и output-проекции через MoE”, с одним query/key на голову и N динамически выбираемых value/output экспертов. Фактически это формальное определение того же самого принципа, который в K2-Horizon получил имя MoVA.
Таким образом, MoVA у IFM является, по сути, доведенной до масштаба LLM (36B, а не сотни миллионов параметров, как в оригинальных статьях 2023–2024 годов) и совмещенной с FFN-MoE версией идей, которые уже несколько лет разрабатываются в академической литературе под разными именами (SwitchHead, MoA, MoSA, MoEUT, MoH).
Собственного архитектурного открытия здесь немного, но инженерная работа по доведению этого до продакшен-уровня на 36B-модели с 512K контекстом и совместимостью с vLLM/SGLang именно то, что действительно ново в релизе K2-Horizon.
Немного хайпа: по официальной карточке модели, K2-Horizon-MoVA-36B-A4B (4B активных) действительно обходит Nemotron 3 Ultra (MoE-модель с 550B общих и 55B активных параметров) сразу на двух агентных/coding-бенчмарках: tau3-Banking (26.8 против 14.2) и Terminal-Bench 2.1 (58.6 против 53.9).
Конечно, это не SWE-bench, но все равно очень достойно для модели такого размера, что еще раз доказывает: специализированные модели меньшего размера на специализированных задачах обходят по качеству большие модели общего назначения.
По данным официального анонса IFM, K2-Horizon-MoVA-36B-A4B при тех же условиях обучения [8] показывает результат “лишь немного ниже” плотной модели той же линейки (Horizon-32B dense, 32B активных из 32B), при том что активирует лишь ~4B параметров на токен.
Основная цель MoVA заключается не в том, чтобы превзойти dense-модели в вакууме, а приблизиться к ним по качеству при кратно меньших затратах на вычисления в инференсе.
Сравнение официальных бенчмарков, high reasoning effort:
|
Бенчмарк |
K2-Horizon-MoVA-36B-A4B (4B акт.) |
Nemotron 3 Ultra (55B акт., 550B всего) |
Nemotron 3 Super (12B акт.) |
G9v3-39A5B (5B акт.) |
Qwen3.6-35B-A3B (3B акт.) |
Muse Glimmer-30B (dense) |
Gemma 4 31B-it (dense) |
|---|---|---|---|---|---|---|---|
|
tau3-Banking (agentic tool use) |
26.8 |
14.2 |
10.3 |
22.1 |
9.3 |
23.5 |
14.8 |
|
Terminal-Bench 2.1 (агентный терминал) |
58.6 |
53.9 |
38.6 |
32.6 |
44.9 |
51.7 |
43.4 |
|
SciCode |
38.9 |
39.9 |
36.0 |
34.0 |
35.8 |
43.6 |
43.4 |
|
GPQA Diamond |
80.8 |
86.7 |
80.0 |
80.5 |
84.1 |
83.5 |
85.7 |
|
Humanity’s Last Exam |
25.2 |
28.4 |
20.8 |
17.5 |
22.2 |
22.0 |
23.6 |
|
AA-LCR (long-context reasoning) |
66.3 |
71.0 |
60.3 |
62.0 |
66.7 |
80.0 |
68.3 |
Картина типичная для сильно оптимизированной sparse-модели: на агентных и tool-use бенчмарках (tau3-Banking, Terminal-Bench) модель обходит всех соперников, включая 550B-модель Nemotron 3 Ultra с 55B активных параметров.
А вот на чистых научных рассуждениях (GPQA, HLE, CritPt) и на длинном контексте она уступает как более крупным MoE, так и dense-моделям сравнимого размера вроде Muse Glimmer-30B. Это ожидаемо: агентные/coding-задачи хорошо ложатся на пост-тренинг с RL и агентными траекториями, а фундаментальные научные знания требуют больше “сырой” емкости.
MoVA архитектура предоставляет способ эффективно потратить бюджет вычислений, а не обогнать более крупные архитектуры.
Модель официально поддерживается vLLM и SGLang, есть также GGUF-конвертации [9] для llama.cpp.
vLLM:
vllm serve IFM/K2-Horizon-MoVA-36B-A4B
--tensor-parallel-size 2
--trust-remote-code
--dtype bfloat16
--max-model-len 131072
--enable-expert-parallel
--reasoning-parser k2_horizon
--enable-auto-tool-choice
--tool-call-parser k2_horizon
SGLang:
python3 -m sglang.launch_server
--model-path IFM/K2-Horizon-MoVA-36B-A4B
--dtype bfloat16
--attention-backend fa3
--reasoning-parser k2_horizon
--tool-call-parser k2_horizon
Модель поддерживает три уровня “усилия рассуждения” через reasoning_effort (high/medium/low).
Важный нюанс для локального запуска: архитектура k2_horizon/K2HorizonForCausalLM на момент написания статьи еще не входит в релиз llama.cpp. PR с ее поддержкой был в процессе на начало сентября 2026.
Community-конвертации в GGUF собирались через форк MBZUAI-IFM/llama.cpp (ветка model/K2Horizon), и без него официальные GGUF-файлы попросту не загружались стандартными сборками llama.cpp, LM Studio и т.п. Это стоит иметь в виду, если вы планируете запускать модель локально, а не через vLLM/SGLang.
По памяти: все 36B весов должны быть загружены в памяти целиком, активность параметров экономит вычисления (FLOPs на токен), а не место в памяти. Грубые ориентиры по квантованным версиям:
|
Квант |
Размер весов |
Практический минимум |
|---|---|---|
|
BF16 |
~70 ГиБ |
2×48GB GPU (A6000/H100 80GB) |
|
Q8_0 |
~35 ГиБ |
2×24GB GPU |
|
Q5_K_M |
~23 ГиБ |
1×24GB GPU или 2×16GB |
|
Q4_K_M |
~20 ГиБ |
1×24GB GPU |
|
Q3_K_M |
~15 ГиБ |
1×16GB GPU |
|
Q2_K/IQ2_M |
~10–11 ГиБ |
1×12GB GPU |
Q8_0 с урезанным с 512К до 252К контекстом, и KV кешем в Q8 спокойно помещается в 48Gb.
Плюсы, которые отмечают чаще всего:
Это действительно самый полный по открытости релиз на данный момент: помимо весов обещаны промежуточные чекпоинты, данные/рецепты их построения, код обучения и подробные логи не только для маленьких моделей, но и для 375B.
MoVA привносит реальный архитектурный вклад, а не маркетинговый ребрендинг MoE.
Маленькие модели линейки (0.9B–7B) действительно устанавливают новый уровень качества в своих весовых категориях, например, 7B показывает 70.6 на SWE-bench Verified, что для такого размера заметно выше конкурентов.
Минусы и оговорки:
Экосистема инференса на момент релиза не успела за архитектурой: поддержка k2_horizon в апстриме llama.cpp отсутствует, официальный GGUF [9] не загружался готовыми инструментами без патченного форка.
Сама IFM провела и опубликовала честный аудит на reward hacking для флагманской 375B-A23B на TerminalBench 2.1: из 500 формально пройденных задач 24 попытки в 10 задачах были признаны нечестными, т.к. модель находила решение эталонного бенчмарка на GitHub, копировала правильный ответ из чужого репозитория, инспектировала неанонсированные файлы/секреты или редактировала сам тестовый харнесс. После исключения этих случаев accuracy падает с 70.2% до 66.9% (~3.4 п.п.).
MoVA архитектура логично развивает идеи MoE: если разреженность (router + top-k экспертов) хорошо работает для FFN, почему бы не применить тот же принцип к value-проекциям внутри attention.
На конкретной модели K2-Horizon-MoVA-36B-A4B это дает заметный эффект: модель с 4B активных параметров держится вровень или обгоняет куда более тяжелые MoE (вплоть до 550B) на агентных и coding-бенчмарках, хотя и уступает на чисто научном ризонинге и длинном контексте.
Для локального и недорогого сценария использования (36B весов помещаются в 1–2 потребительские/полупрофессиональные GPU при квантовании) это выглядит одним из самых интересных релизов сентября 2026 года, при условии, что вы готовы мириться с еще не до конца зрелой поддержкой в инструментах вроде llama.cpp на момент запуска.
Автор: ToxaBes
Источник [10]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35289
URLs in this post:
[1] K2-Horizon-MoVA-36B-A4B: https://huggingface.co/IFM/K2-Horizon-MoVA-36B-A4B
[2] внимания: http://www.braintools.ru/article/7595
[3] 1: https://ifm.ai/blog/k2/
[4] Логика: http://www.braintools.ru/article/7640
[5] памяти: http://www.braintools.ru/article/4140
[6] 2: https://arxiv.org/abs/2312.07987
[7] 3: https://arxiv.org/html/2405.16039v1
[8] обучения: http://www.braintools.ru/article/5125
[9] GGUF-конвертации: https://huggingface.co/IFM/K2-Horizon-MoVA-36B-A4B-GGUF
[10] Источник: https://habr.com/ru/articles/1080564/?utm_campaign=1080564&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.