moe.
DeepSeek 0731 на DGX Spark: разгоняю до 68 tok-s и разбираюсь, почему у автора карточки 57
TL;DRЖелезо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03.Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет.Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80.Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto
Kimi K3 — что реально даёт открытие весов самой большой модели
27 июля Moonshot AI выложила веса Kimi K3 — модели на 2,8 трлн параметров, которая до этого работала только через платный API. Вместе с весами открыли технический отчёт и три внутренних инструмента, на которых модель обучали.
Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток-с на AMD Strix Halo
Согласно опубликованным бенчмаркам, Ornith‑1.0‑35B показала себя лучше Qwen3.5‑397B‑A17B в тех тестах, где модель должна не просто написать код, а самостоятельно работать в терминале и пользоваться инструментами. На Terminal‑Bench 2.1 с Terminus‑2 разница составила 64,2% против 53,5%.BenchmarkOrnith‑1.0‑35BQwen3.5‑397BOrnith − QwenTerminal‑Bench 2.1, Terminus‑264,253,5+10,7Terminal‑Bench 2.1, Claude Code62,848,6+14,2SWE‑bench Verified
Thinking Machines Lab представила Inkling – open-weights модель с 975 млрд параметров и ставкой на кастомизацию
Стартап Thinking Machines Lab, основанный бывшим CTO OpenAI Мирой Мурати, выпустил свою первую фундаментальную модель — Inkling. Вместо гонки за лидерством в бенчмарках компания делает ставку на открытые веса, мультимодальность и инфраструктуру для глубокой кастомизации моделей под конкретные продукты.По характеристикам релиз получился одним из самых крупных среди открытых моделей:975 млрд параметров (архитектура Mixture-of-Experts);41 млрд активных параметров на токен;контекстное окно до 1 млн токенов;предварительное обучение на 45 трлн токенов, включающих текст, изображения, аудио и видео.
GigaChat 3.5 — меньше, быстрее, сильнее
Салют, Хабр!Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — нашу новую 432B-модель. В этом релизе мы впервые для нашей линейки масштабировали собственную гибридную архитектуру на сотни миллиардов параметров, ускорили инференс и усилили модель в коде, агентных сценариях и сложных областях.GigaChat 3.5 Ultra компактнее прошлого флагмана: 432 млрд параметров вместо 700 млрд у GigaChat 3.1 Ultra. Но это не компромисс «меньше, зато дешевле»: за счёт новых данных, обновлённого рецепта обучения и архитектурных изменений модель стала сильнее, а также эффективнее по памяти и скорости генерации.Интересно? Добро пожаловать под кат.
Почему дорогая LLM дороже: экономика инференса, которую видно в твоём 5-часовом лимите
Это очень интересный длиннопост о том, что именно показывают 5-ти часовые и недельные лимиты в Claude / GPT / Gemini и что происходит под капотом
LongCat 2.0: модель на трлн параметров, обученная на 50 тысячах китайских чипов
Meituan представила LongCat 2.0 — первую в мире модель масштаба триллиона параметров, полностью обученную на китайских процессорах. Кто, зачем и на чёмMeituan (суперапп доставки еды) три года инвестировала в AI-инфраструктуру. Результат — модель LongCat 2.0,
Как измеряют LLM: параметры, бенчмарки и тесты на коленке
В комментариях к моей предыдущей статье о тестировании трех флагманских LLM моделей были примерно такие мысли и вопросы:Я взял простую бесплатную LLM, запустил локально и она тоже справилась.А почему вы в свое сравнение не взяли никого от DeepSeek, они же тоже хороши?А зачем всем один и тот же промпт, они же по-разному их воспринимают?
Cerebras ускорила 1 трлн модель kimi K2.6 до тысяча т-sec
Недавно компания производитель чипов Cerebras добавила топовую открытую трилионную модель Kimi k2.6, на свою платформу.

