inference.

Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо: загрузить веса, поднять runtime, отдать API, подключить приложение.Теорию я понимал. Но честный ответ был таким: собственного опыта, в котором всё это проходит путь от файлов модели до работающего пользовательского сценария, у меня тогда не было.Через несколько дней такой опыт появился.

продолжить чтение

Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же

Я прогнал топ выдачи Google по «llm vram calculator» — от самого навороченного до однокнопочных. Все ошибаются в одном и том же: ни один не моделирует, что движок резервирует почти всю память под пул заранее, а не раздаёт её под KV по мере запросов. Ответ «сколько запросов влезет» из-за этого всегда мимо.Наивное большинство спотыкается ещё и о геометрию KV: на DeepSeek-V2-Lite обычная формула завышает память почти на порядок (в 7–11 раз). Разбираю обе ловушки и сверяю числа с живым vLLM.Ошибка №1: движок забирает память заранееПишете две строки:from vllm import LLM llm = LLM("meta-llama/Meta-Llama-3-8B-Instruct")

продолжить чтение

Как мы внедрили AIOps для контроля GPU‑утилизации и повысили её на 60%

Привет, Хабр! На связи Даниил Понизов и Роман Лазовский, руководитель и MLOps‑инженер команды ML‑платформы в RWB. Мы занимаемся разработкой платформы машинного обучения, в том числе — контролируем инфраструктуру и эффективное использование ресурсов.Недавно проходил Inside AI Meetup, где мы рассказали про внедрение AIOps практик в нашей команде — видеозапись вы найдете тут.

продолжить чтение

Инференс LLM: от KV-кэша до продакшен-деплоя

Привет! Я Саша Рыжов, MLOps-инженер в hh.ru, уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед.

продолжить чтение

Как оптимизировать инференс LLM: кеширование, время ответа и GPU-ресурсы

Вы запустили LLM-инференс в продакшене.

продолжить чтение

Много нас, а он один: распределение GPU между ML-инженерами с помощью Dev Cluster

За последние десять лет в мире машинного обучения произошёл взрывной рост. Если в 2012 году мощную модель можно было обучить на нескольких GPU, то сегодня бигтехам нужны тысячи. Вместе с железом выросла и головная боль: как дать всем ML-инженерам доступ к дефицитному ресурсу так, чтобы это не превращалось в постоянные просьбы из разряда «пожалуйста, почистите диск!!!».Расскажу про Dev Cluster — инструмент, который создали в команде ML Platform (Yandex Infrastructure) для гибкого распределения GPU между ML-разработчиками. GPU сложно шерить 

продолжить чтение

Xiaomi разогнали 1T-модель до 1200 tok-s на стандартных GPU

Китайские команды MiMo и TileRT опубликовали режим UltraSpeed для модели MiMo V2.5 Pro (1,02T параметров).На одном 8-карточном сервере со стандартными GPU, до ~1200 токенов в секунду. Cerebras выдаёт похожие скорости на кастомном железе. Здесь обошлись без него.

продолжить чтение

Как работает адаптивный RAG, которому вообще не нужна LLM

продолжить чтение

Cerebras ускорила 1 трлн модель kimi K2.6 до тысяча т-sec

Недавно компания производитель чипов Cerebras добавила топовую открытую трилионную модель Kimi k2.6, на свою платформу.

продолжить чтение

Дезагрегированный инференс LLM в Kubernetes: префилл, декодирование и планирование подов

продолжить чтение