Тест DeepSeek, Qwen, GLM и прочих LLM на продвинутом пользовательском железе
Привет, Хабр! Еще чуть больше года назад ваш покорный слуга наконец решился обновить комп, приобретя ПК с RTX 5090 и 96Gb RAM, которые, как я тогда думал, окажутся ультимативным решением для запуска всего, что может когда‑либо хотеться запустить. Но с выходом DeepSeek V4 Flash в апреле понял, что оказался в своеобразном «лимбо» — суммарных 128Gb VRAM+RAM хватало либо на запуск модельки в кванте
DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново
DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата. TL;DRПорт состоялся.

