vllm.

Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve

Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента.

продолжить чтение

Хватит сливать данные в Claude и GPT: как поднять свой on‑prem LLM

Да, вы абсолютно правы ✅ Это изображение подходит в вашу статью ✅ Будут еще вопросы, обращайтесь 😊

продолжить чтение

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

продолжить чтение

Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле

Разговор повторяется примерно раз в месяц, с небольшими вариациями.— Мы за API платим уже прилично. Может, купим карту и будем гонять у себя? — Может. Сколько токенов в месяц жжете? — Ну... много.Вот на этом месте всегда наступает пауза. Потому что «много» никто не считал, а без этой цифры весь разговор превращается в обмен ощущениями.

продолжить чтение

DeepSeek 0731 на DGX Spark: разгоняю до 68 tok-s и разбираюсь, почему у автора карточки 57

TL;DRЖелезо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03.Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет.Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80.Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto

продолжить чтение

Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает full attention

Гибридные модели обещают простую вещь. Память под контекст перестаёт расти линейно с его длиной, значит длинный контекст дешевеет, значит на ту же карту влезает больше пользователей. Звучит настолько разумно, что проверять как-то неловко.Я всё-таки проверил, потому что интересовало как эта архитектура будет вести себя под нагрузкой и вписываться в существующий стек инференса. Снял на вечер машину с двумя RTX 3090 и прогнал по двум моделям одну и ту же агентскую нагрузку. Qwen3-4B: обычная, полная аттеншн во всех 36 слоях. Qwen3.5-4B: гибридная, полная аттеншн осталась в 8 слоях из 32, а остальные 24 заменены на рекуррентные слои Gated DeltaNet (

продолжить чтение

350+ моделей без смены SDK: зачем разработчику слой абстракции над LLM‑провайдерами

Привет, Хабр! На связи команда Caila

продолжить чтение

Локальный запуск LLM для SOC: сколько инцидентов обработает одна GPU? Часть 2

Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R‑Vision.В первой части эксперимента мы выяснили, как на производительность локальной LLM влияют длина контекста, количество параллельных запросов и объем генерируемого ответа. Стресс‑тесты позволили определить границы конфигурации Qwen3.5–122B‑A10B‑GPTQ, vLLM и NVIDIA RTX PRO 6000 Blackwell Max‑Q с 96 GB видеопамяти.

продолжить чтение

Инференс LLM: от KV-кэша до продакшен-деплоя

Привет! Я Саша Рыжов, MLOps-инженер в hh.ru, уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед.

продолжить чтение

Локальный запуск LLM для SOC: сколько GPU действительно нужно?

Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R-Vision.Когда речь заходит о локальном запуске больших языковых моделей, обычно первым возникает вопрос стоимости инфраструктуры: «Self-hosted LLM — это десятки или сотни GPU?». Для обучения foundation-моделей или публичных сервисов с миллионами пользователей это действительно так. Но применение LLM внутри SOC устроено иначе.

продолжить чтение