LLM-инференс.

Как делят GPU в докладах KubeCon Japan 2026 и у нас в Авито

Привет, Хабр! Меня зовут Антон Алексеев, я MLOps-инженер в Авито. В конце июля мы с коллегами съездили в Иокогаму на KubeCon + CloudNativeCon Japan 2026. Ко второму дню я заметил, что слайды выступающих повторяются: спектр изоляции тенантов, квоты, bin packing, «GPU дорогие — давайте делить». Мы решаем в Авито ту же задачу, поэтому я разберу шесть докладов про GPU и LLM-инференс и расскажу, что из этого мы уже пробовали или собираемся попробовать. А в конце будет немного про саму Японию.СодержаниеИнференс обогнал обучение

продолжить чтение

DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата. TL;DRПорт состоялся.

продолжить чтение

ML-дайджест: автономные агенты, новый стандарт безопасности и инференс-гонка

Пока индустрия спорит о «пузыре», обсуждая, почему оценка очередного стартапа с одной оберткой над GPT-5 на высоте, реальный сектор строит

продолжить чтение