инференс.

CMF: решения за миллисекунды без генерации токенов (аналог Jev) с открытыми весами

Сейчас очень много обсуждают модель Jev от Typesafe, я решил выложить модель в своем CMF формате для личного использования (License:apache-2.0) которая давно работает на шлюзеКак это работает? Например пользователь пишет, что карта так и не пришла. Приложению нужно выбрать card_arrival и передать обращение в нужный обработчик, или напиши функцию на go, принять решения нужно максимально быстро. Таких развилок много: выбрать инструмент агента, определить тему заявки, сложность, направить документ на проверку, определить сложность и тип задачи.Для этих задач я опубликовал CMF Decision

продолжить чтение

Почему инференс LLM становится дорогим и как снизить расходы на GPU без покупки новых карт

Материал подготовлен в рамках курса «MLOps».Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про то, как снизить стоимость инференса LLM на собственных GPU, не меняя

продолжить чтение

Российский нейрочип от НТЦ «Модуль»

Дополнение к части 2 «Рынок вычислений в России, Казахстане и Беларуси» — то, что не вошло в основной текстВ части 2 про рынок вычислений есть фраза, которую я написал между делом: «…и нишевые нейропроцессоры НТЦ "Модуль"». Скобка, запятая — и дальше про память и электричество. Но я споткнулся о скобку: про эти процессоры я слышал давно, всерьёз не разбирался, а цифр перед глазами не держал. Проверил. Погрузился. И чем глубже капал, тем яснее было: этому процессору нужна отдельная статья.История.

продолжить чтение

Векторный поиск: деплой без GPU на Triton Inference Server

Перед каждым ML-разработчиком, после обучения прекрасной модели, которая поднимет бизнесу метрики, а тебе годовую премию, возникает вопрос: а как ее задеплоить в сервисе, чтоб она начала работать?А ты пошел отдыхать.

продолжить чтение

Open‑weight LLM догнали закрытые? Проверка на продакшене

Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу, почему фраза «open‑weight модели догнали закрытые» почти верна для бенчмарков и опасна для вашего продакшена. Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.Представьте: пятница, вечер, в рабочий чат кто‑то кидает скриншот бенчмарка. Открытая модель отстаёт от флагмана за 25 долларов за миллион выходных токенов на пару пунктов. Через десять минут в тред приходит финансовый директор с вопросом:«А зачем мы платим в десятки раз больше?»

продолжить чтение

Давай по новой, Миша: speculative decoding от черновика до проверки

Маленькая модель быстро генерирует несколько следующих токенов, а большая проверяет их сразу одной пачкой. Подходящие токены принимаются, а с первого расхождения большая модель продолжает генерацию сама. При корректной реализации итоговое распределение остаётся тем же, что и при обычном декодировании. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша».На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса.

продолжить чтение

«Друзья не дают друзьям пользоваться Ollama»

Ниже — перевод статьи «Friends Don’t Let Friends Use Ollama»

продолжить чтение

Как устроены LLM: разбираем на примере 3-уровневой абстракции

Чтобы оптимизировать производительность больших языковых моделей (LLM), необходимо понимать весь программный стек. Мне не удалось найти подробную статью, которая показывала бы этот стек как общую картину, поэтому я решил написать такую статью сам. Эта статья не является исчерпывающим обзором или набором наилучших практик. Здесь я в большей степени делюсь моими общими представлениями о том, как выглядит ландшафт современных LLM‑систем.Во‑первых, любая система проектируется с расчётом на достижение конкретных целей с учётом заданных ограничений. В LLM‑системах наиболее принципиальные цели связаны с увеличением

продолжить чтение

Железо для ИИ: почему стандартный сервер не справится и как мы проектировали аппаратный стек ПАК

Привет, Хабр! Продолжаем цикл про инфраструктуру для ИИ-задач. В первой статье

продолжить чтение

Спекулятивное декодирование: от чего на самом деле зависит ускорение

Языковая модель пишет ответ по одному токену за шаг, и на каждом шаге прочитывает все свои веса от начала до конца. Спекулятивное декодирование пытается это обойти: маленькая черновая модель набрасывает несколько токенов вперёд, причём сразу деревом вариантов, а большая проверяет всё это дерево за один свой проход и принимает ту ветку, которая совпала с её собственным выбором. Текст на выходе получается тот же самый, быстрее становится только его получение. Так устроен метод из статьи EAGLE-3 с NeurIPS 2025, и авторы приводят для него ускорение до 6.5 раза.

продолжить чтение

123456...7