оптимизация.

Почему инференс LLM становится дорогим и как снизить расходы на GPU без покупки новых карт

Материал подготовлен в рамках курса «MLOps».Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про то, как снизить стоимость инференса LLM на собственных GPU, не меняя

продолжить чтение

Теория возможностей заменит теорию вероятностей в ML?

Современные генеративные модели используют мощный аппарат теории вероятностей: байесовскую оптимизацию, оценки максимального правдоподобия и тп. Но у этого подхода есть свои недостатки, например, галлюцинации, с которыми, наверняка, большинство сталкивалось при работе с ИИ. Проведем обзор не новой, но набирающей популярность теории возможностей и ее использования в машинном обучении. Для этого проанализируем доклад профессора Наньянского технологического (Сингапур) и Уорикского университетов (Великобритания) Jeremie Houssineau.

продолжить чтение

Давай по новой, Миша: speculative decoding от черновика до проверки

Маленькая модель быстро генерирует несколько следующих токенов, а большая проверяет их сразу одной пачкой. Подходящие токены принимаются, а с первого расхождения большая модель продолжает генерацию сама. При корректной реализации итоговое распределение остаётся тем же, что и при обычном декодировании. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша».На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса.

продолжить чтение

Как устроены LLM: разбираем на примере 3-уровневой абстракции

Чтобы оптимизировать производительность больших языковых моделей (LLM), необходимо понимать весь программный стек. Мне не удалось найти подробную статью, которая показывала бы этот стек как общую картину, поэтому я решил написать такую статью сам. Эта статья не является исчерпывающим обзором или набором наилучших практик. Здесь я в большей степени делюсь моими общими представлениями о том, как выглядит ландшафт современных LLM‑систем.Во‑первых, любая система проектируется с расчётом на достижение конкретных целей с учётом заданных ограничений. В LLM‑системах наиболее принципиальные цели связаны с увеличением

продолжить чтение

AI‑Evolution #1. Как я начал создавать свой мир

Недавно увлекся чтением книг о нашей психологии, привычках и теории игр. Но мне всегда было интересно посмотреть, как эти законы работают на практике.Помимо книг о психологии, я попутно изучаю линейную алгебру и искусственный интеллект. И чтобы не учиться «в стол», я начал пет‑проект — мультиагентную песочницу эволюции. Я создаю цифровой мир на TypeScript и Python, где маленькие агенты будут управляться простейшими нейросетями и выживать по законам жесткого отбора.

продолжить чтение

Симулятор жизни на Python + TypeScript + HTML5 Canvas. Введение. Проектирование среды и базовой механики агентов

Недавно увлекся чтением книг о нашей психологии, привычках и теории игр. Но мне всегда было интересно посмотреть, как эти законы работают на практике.Помимо книг о психологии, я попутно изучаю линейную алгебру и искусственный интеллект. И чтобы не учиться «в стол», я начал пет‑проект — мультиагентную песочницу эволюции. Я создаю цифровой мир на TypeScript и Python, где маленькие агенты будут управляться простейшими нейросетями и выживать по законам жесткого отбора.

продолжить чтение

Контекст растёт, KV-кэш — нет: Qwen3.8-27B на ограниченной VRAM с CMF формате

Экспериментальный O(1)-режим CMF заменяет растущий KV-кэш в 16 full-attention слоях Qwen3.8-27B фиксированным состоянием 44,1 МиБ. На длине 64K это сопоставляется с 4 ГиБ FP16 KV-кэша, но ценой приближённого восстановления дальнего контекста.Статья про CMF форматВ CMF

продолжить чтение

Чит‑код к реальности: как я устал от школы и написал для 15-летней дочери мануал по нейробиологии и логике

Всё началось в 7–8 классе, когда система начала давать сбой. Дочь просто перестала вытягивать школьную нагрузку. Организм рос стремительно — заболели коленные суставы, посыпались частые простуды, ресурс ЦНС уходил в минус.

продолжить чтение

Квантизация LLM: как запихнуть 70B модель в свою видюху

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

продолжить чтение

Tymbal — нейросинтезатор на одном чипе

0. Об имениИнструмент называется Tymbal.Характер задаёт учитель — обработанный сигнал, на который натаскивается уточнитель. Смените учителя, и характер сменится целиком, а конструкция останется прежней.Tymbal — орган звукоизвлечения цикады: ребристая мембрана, которая щёлкает при нелинейном выгибании. Маленький аппарат, громкий и богатый обертонами результат, и весь механизм держится на одной нелинейности. У нас нелинейность учителя переносится сетью на детерминированный скелет, и всё это живёт на одном чипе.Слово к тому же приходит оттуда же, откуда «тембр». Merriam‑Webster выводит tymbal

продолжить чтение

123456...10...12