- BrainTools - https://www.braintools.ru -
Китайские команды MiMo и TileRT опубликовали [1] режим UltraSpeed для модели MiMo V2.5 Pro (1,02T параметров).
На одном 8-карточном сервере со стандартными GPU, до ~1200 токенов в секунду. Cerebras [2] выдаёт похожие скорости на кастомном железе. Здесь обошлись без него.

В кратце работает так:
MoE-слои сжали с 16 до 4 бит: они занимают большую часть весов и хорошо переносят потерю точности, остальное оставили нетронутым
Рядом с основной моделью запускается маленькая, которая угадывает сразу 8 токенов вперёд
Основная проверяет их разом и принимает правильные
В coding-сценариях угадывается ~6,3 токенов из 8
Похожий механизм Google применяет в Gemma 4 [3].
На видео можно заценить скорость: 12 секунд против 6 минут на стандартных скоростях, к которым мы сейчас привыкли.

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI-агентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь [4], чтобы быть в курсе и ничего не упустить!
Автор: python_leader
Источник [5]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/31494
URLs in this post:
[1] опубликовали: https://mimo.xiaomi.com/blog/mimo-tilert-1000tps
[2] Cerebras: https://www.cerebras.ai/blog/why-the-ai-race-shifted-to-speed
[3] применяет в Gemma 4: https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/
[4] Подписывайтесь: https://t.me/+waCDtNrGXu40ZjBi
[5] Источник: https://habr.com/ru/news/1045594/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1045594
Нажмите здесь для печати.