inference.

Инференс LLM: от KV-кэша до продакшен-деплоя

Привет! Я Саша Рыжов, MLOps-инженер в hh.ru, уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед.

продолжить чтение

Как оптимизировать инференс LLM: кеширование, время ответа и GPU-ресурсы

Вы запустили LLM-инференс в продакшене.

продолжить чтение

Много нас, а он один: распределение GPU между ML-инженерами с помощью Dev Cluster

За последние десять лет в мире машинного обучения произошёл взрывной рост. Если в 2012 году мощную модель можно было обучить на нескольких GPU, то сегодня бигтехам нужны тысячи. Вместе с железом выросла и головная боль: как дать всем ML-инженерам доступ к дефицитному ресурсу так, чтобы это не превращалось в постоянные просьбы из разряда «пожалуйста, почистите диск!!!».Расскажу про Dev Cluster — инструмент, который создали в команде ML Platform (Yandex Infrastructure) для гибкого распределения GPU между ML-разработчиками. GPU сложно шерить 

продолжить чтение

Xiaomi разогнали 1T-модель до 1200 tok-s на стандартных GPU

Китайские команды MiMo и TileRT опубликовали режим UltraSpeed для модели MiMo V2.5 Pro (1,02T параметров).На одном 8-карточном сервере со стандартными GPU, до ~1200 токенов в секунду. Cerebras выдаёт похожие скорости на кастомном железе. Здесь обошлись без него.

продолжить чтение

Как работает адаптивный RAG, которому вообще не нужна LLM

продолжить чтение

Cerebras ускорила 1 трлн модель kimi K2.6 до тысяча т-sec

Недавно компания производитель чипов Cerebras добавила топовую открытую трилионную модель Kimi k2.6, на свою платформу.

продолжить чтение

Дезагрегированный инференс LLM в Kubernetes: префилл, декодирование и планирование подов

продолжить чтение

Гайды по nxs-universal-chart v3.0: AI Inference контур на основе KServe

продолжить чтение

Как развернуть Qwen в облаке так, чтобы модель не была доступна из интернета

продолжить чтение

Практическое руководство по Qwen: установка, настройка vLLM и работа через API

продолжить чтение

123