ускорение.

Нейронные сети нетрадиционного ускорения

Главным бутылочным горлышком инференса современных языковых моделей является пропускная способность памяти, ведь из-за использования авторегрессионной генерации ради получения всего одного токена модели вынуждены прогонять через видеопамять все гигабайты весов.Решением этой проблемы стало спекулятивное декодирование: лёгкая модель-черновик (drafter) быстро генерирует последовательность токенов, а большая целевая модель проверяет весь блок за один параллельный проход.

продолжить чтение

LLM Inside: выжимаем максимум из Decoder Attention на GPU

продолжить чтение

EvoPress: новый подход к оптимизации и сжатию LLM от исследователей Яндекса

продолжить чтение

Фильтр Гаусса на стероидах: секреты ускорения вычислений

Привет, Хабр! Представьте, что вы пытаетесь обработать фотографию высокого разрешения на вашем смартфоне — добавить размытие, убрать шум или улучшить качество изображения. Кажется, задача проста, но за кулисами работает алгоритм, требующий немало вычислительных ресурсов. Речь идет о фильтре Гаусса – одной из самых популярных операций в области компьютерной обработки изображений.

продолжить чтение