спекулятивный декодинг.

Мини‑ПК на Strix Halo под параллельной нагрузкой: 236 tok-s на 32 одновременных запросах и три ошибки

продолжить чтение

DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата. TL;DRПорт состоялся.

продолжить чтение

Как оптимизировать LLM-инференс в 2026 году

продолжить чтение

Повторяй промт дважды — и нейросеть станет умнее. Это реально работает

Ещё раз: повторяй промт дважды — и нейросеть станет умнее. Это реально работает!Пример повторящегося промта со вставкой посерединеИсследователи Google Яньив Левиатан, Матан Кальман и Йосси Матиас 

продолжить чтение

Алгоритмы спекулятивного инференса LLM

ВведениеЗа последние годы качество LLM моделей сильно выросло, методы квантизации стали лучше, а видеокарты мощнее. Тем не менее качество генерации все еще напрямую зависит от размера весов и, как следствие, вычислительной сложности. Кроме того, генерация текста авторегрессионна - токен за токеном по одному, потому ее сложность зависит от размера контекста и количества генерируемых токенов.Но генерация текста не всегда имеет однородную сложность, так же как мы во многом мыслим идеями, а слова произносим “на автомате”. В статье обсудим алгоритмы, позволяющие использовать эту неоднородность для ускорения.

продолжить чтение