vllm.
Выбор агентской модели для кластеров из 2× DGX Spark (сентябрь 2026)
В сентябре 2026 года на Hugging Face есть 3 модели, которые хочется поставить на пару DGX Spark под Claude Code: DeepSeek‑V4.1-Flash на 552B, GLM-5.3-Flash на 320B и Qwen3.8-Flash‑Next на 125B. Первая лучше всех в бенчмарках, но не помещается в 243 ГиБ даже в 4 битах. Вторая занимает 198 ГБ и грузится 15 минут. Третья влезает в один спарк — если не считать 2 ГБ, которых ей не хватает. Ниже — почему на этом кластере выбор делает арифметика памяти, а не таблица бенчмарков, почему 6 миллиардов активных параметров не дают 90 ток/с, и почему для Claude Code решающим оказывается не tok/s, а один флаг vLLM, который в самом быстром конфиге выключен.
Давай по новой, Миша: speculative decoding от черновика до проверки
Маленькая модель быстро генерирует несколько следующих токенов, а большая проверяет их сразу одной пачкой. Подходящие токены принимаются, а с первого расхождения большая модель продолжает генерацию сама. При корректной реализации итоговое распределение остаётся тем же, что и при обычном декодировании. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша».На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса.
Запустить LLM локально: что считать до покупки видеокарты?
Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java/Kotlin‑разработки в FinTech & E‑commerce, преподаю на курсах разработки и архитектуры в ОТУС.В этой статье расскажу про домашний стенд для локального инференса
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо: загрузить веса, поднять runtime, отдать API, подключить приложение.Теорию я понимал. Но честный ответ был таким: собственного опыта, в котором всё это проходит путь от файлов модели до работающего пользовательского сценария, у меня тогда не было.Через несколько дней такой опыт появился.
Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же
Я прогнал топ выдачи Google по «llm vram calculator» — от самого навороченного до однокнопочных. Все ошибаются в одном и том же: ни один не моделирует, что движок резервирует почти всю память под пул заранее, а не раздаёт её под KV по мере запросов. Ответ «сколько запросов влезет» из-за этого всегда мимо.Наивное большинство спотыкается ещё и о геометрию KV: на DeepSeek-V2-Lite обычная формула завышает память почти на порядок (в 7–11 раз). Разбираю обе ловушки и сверяю числа с живым vLLM.Ошибка №1: движок забирает память заранееПишете две строки:from vllm import LLM llm = LLM("meta-llama/Meta-Llama-3-8B-Instruct")
LLM зацикливается: как найти причину, не трогая параметры?
Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про аварию, которую сложно поймать тестами.Сервис на базе LLM три недели работает нормально, а потом начинает отдавать отчёты, где с середины примерно двадцать раз подряд идёт один и тот же абзац, а дальше — обрыв на полуслове. Пользователи присылают скриншоты, GPU занят
IBM уходит в Agentic RL: три новые модели Granite 4.2 научили автономно программировать в терминале
25 августа IBM Research опубликовала Granite 4.2
Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег
Все цифры сняты с работающего стенда: потребление токенов — за календарную неделю по данным шлюза, метрики движка — кумулятивно за период аптайма (11 426 обработанных запросов). Продолжение — про выбор модели по замерам, а не по бенчмаркам — будет отдельной статьёй.Для кого эта статьяДля тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не введение в трансформеры.

