Почему инференс LLM становится дорогим и как снизить расходы на GPU без покупки новых карт
Материал подготовлен в рамках курса «MLOps».Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про то, как снизить стоимость инференса LLM на собственных GPU, не меняя
Российский нейрочип от НТЦ «Модуль»
Дополнение к части 2 «Рынок вычислений в России, Казахстане и Беларуси» — то, что не вошло в основной текстВ части 2 про рынок вычислений есть фраза, которую я написал между делом: «…и нишевые нейропроцессоры НТЦ "Модуль"». Скобка, запятая — и дальше про память и электричество. Но я споткнулся о скобку: про эти процессоры я слышал давно, всерьёз не разбирался, а цифр перед глазами не держал. Проверил. Погрузился. И чем глубже капал, тем яснее было: этому процессору нужна отдельная статья.История.
Open‑weight LLM догнали закрытые? Проверка на продакшене
Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу, почему фраза «open‑weight модели догнали закрытые» почти верна для бенчмарков и опасна для вашего продакшена. Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.Представьте: пятница, вечер, в рабочий чат кто‑то кидает скриншот бенчмарка. Открытая модель отстаёт от флагмана за 25 долларов за миллион выходных токенов на пару пунктов. Через десять минут в тред приходит финансовый директор с вопросом:«А зачем мы платим в десятки раз больше?»
Давай по новой, Миша: speculative decoding от черновика до проверки
Маленькая модель быстро генерирует несколько следующих токенов, а большая проверяет их сразу одной пачкой. Подходящие токены принимаются, а с первого расхождения большая модель продолжает генерацию сама. При корректной реализации итоговое распределение остаётся тем же, что и при обычном декодировании. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша».На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса.
«Друзья не дают друзьям пользоваться Ollama»
Ниже — перевод статьи «Friends Don’t Let Friends Use Ollama»
Как устроены LLM: разбираем на примере 3-уровневой абстракции
Чтобы оптимизировать производительность больших языковых моделей (LLM), необходимо понимать весь программный стек. Мне не удалось найти подробную статью, которая показывала бы этот стек как общую картину, поэтому я решил написать такую статью сам. Эта статья не является исчерпывающим обзором или набором наилучших практик. Здесь я в большей степени делюсь моими общими представлениями о том, как выглядит ландшафт современных LLM‑систем.Во‑первых, любая система проектируется с расчётом на достижение конкретных целей с учётом заданных ограничений. В LLM‑системах наиболее принципиальные цели связаны с увеличением
Железо для ИИ: почему стандартный сервер не справится и как мы проектировали аппаратный стек ПАК
Привет, Хабр! Продолжаем цикл про инфраструктуру для ИИ-задач. В первой статье
Спекулятивное декодирование: от чего на самом деле зависит ускорение
Языковая модель пишет ответ по одному токену за шаг, и на каждом шаге прочитывает все свои веса от начала до конца. Спекулятивное декодирование пытается это обойти: маленькая черновая модель набрасывает несколько токенов вперёд, причём сразу деревом вариантов, а большая проверяет всё это дерево за один свой проход и принимает ту ветку, которая совпала с её собственным выбором. Текст на выходе получается тот же самый, быстрее становится только его получение. Так устроен метод из статьи EAGLE-3 с NeurIPS 2025, и авторы приводят для него ускорение до 6.5 раза.

