moe.
Выбор агентской модели для кластеров из 2× DGX Spark (сентябрь 2026)
В сентябре 2026 года на Hugging Face есть 3 модели, которые хочется поставить на пару DGX Spark под Claude Code: DeepSeek‑V4.1-Flash на 552B, GLM-5.3-Flash на 320B и Qwen3.8-Flash‑Next на 125B. Первая лучше всех в бенчмарках, но не помещается в 243 ГиБ даже в 4 битах. Вторая занимает 198 ГБ и грузится 15 минут. Третья влезает в один спарк — если не считать 2 ГБ, которых ей не хватает. Ниже — почему на этом кластере выбор делает арифметика памяти, а не таблица бенчмарков, почему 6 миллиардов активных параметров не дают 90 ток/с, и почему для Claude Code решающим оказывается не tok/s, а один флаг vLLM, который в самом быстром конфиге выключен.
Как 17B активных бьют 70B плотных: анатомия Mixture-of-Experts (MoE)
Если вдруг вы моргнули на моменте, когда разработчики нейросетей мерились у кого больше цифра рядом с названием модели, а выморгнув, обнаружили, что теперь модно флексить скромными размерами активных параметров, эта статья для вас. Сегодня объясняю, как же так произошло, что все флагманы опенсорса внезапно стали MoE, почему Qwen3.5 на 397 миллиардов параметров строчит токены, как будто ей 17 и почему никто не разорился на видеокартах.Ну и для тех, кому «только спросить» откроем тайну: в каком же кабинете у MoE живет эксперт по медицине.
DeepSeek V4.1-Flash: новая архитектура, 552 млрд параметров и агентные тесты
DeepSeek вывела V4.1-Flash — младшую модель новой архитектурной линейки компании. Это MoE-модель на 552 млрд параметров с нативной поддержкой изображений, контекстом до 1 млн токенов и отдельными режимами reasoning.Наиболее интересная часть релиза — архитектурные изменения. DeepSeek перешла к асимметричной схеме Causal Encoder–Decoder: при prefill активируется около 8 млрд параметров на токен, а при decode — 16 млрд. То есть вычислительный бюджет для обработки входа и генерации намеренно сделали разным.
MoVA: новая архитектура внимания
3 сентября 2026 года Institute of Foundation Models (IFM, подразделение MBZUAI) выкатил зоопарк из шести открытых моделей K2 Horizon размером от 0.9B до 375B параметров. Технически самой интересной из них оказалась средняя модель, K2-Horizon-MoVA-36B-A4B: 36 млрд параметров, из которых на каждый токен работает только около 4 млрд. Формально это MoE-модель, но авторы добавили в нее второй слой разреженности прямо в attention слои и назвали это MoVA, Mixture-of-Value Attention.Как работает MoE
CMF: новый формат для создания специализированных LLM моделей
Универсальные языковые модели умеют решать множество задач, но за эту универсальность приходится платить: они большие, тяжёлые и содержат множество переплетённых способностей сразу. Мне хотелось научиться брать уже обученную LLM и компилировать её под конкретную работу, получая компактного специалиста, который можно запускать на более дешевом оборудовании.При этом одна универсальная модель могла бы служить основой для целого семейства таких специалистов с автоматическим выбором подходящего под каждый запрос.
Почему MoE-модель тормозит? Чек-лист из трех шагов
Автор перевода и адаптации статьи - Данил Г., Python-разработчикДля кого эта статьяВы запускаете большую MoE‑модель (например, Qwen, DeepSeek, Mixtral) на локальной машине через llama.cpp / llama-server
753B на одной видеокарте: разбор FreeToken
Чувак из Калифорнии вряд ли запускает это все на таком ноутбуке
Как запустить LLM на 2,8 трлн параметров на ноутбуке
Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про то, как летом 2026 года большие языковые модели научились запускаться на железе, которое стоит под столом, а не в дата‑центре, и что из этого может забрать себе обычный backend‑инженер.Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.

