Нейронные сети нетрадиционного ускорения
Главным бутылочным горлышком инференса современных языковых моделей является пропускная способность памяти, ведь из-за использования авторегрессионной генерации ради получения всего одного токена модели вынуждены прогонять через видеопамять все гигабайты весов.Решением этой проблемы стало спекулятивное декодирование: лёгкая модель-черновик (drafter) быстро генерирует последовательность токенов, а большая целевая модель проверяет весь блок за один параллельный проход.
Фильтр Гаусса на стероидах: секреты ускорения вычислений
Привет, Хабр! Представьте, что вы пытаетесь обработать фотографию высокого разрешения на вашем смартфоне — добавить размытие, убрать шум или улучшить качество изображения. Кажется, задача проста, но за кулисами работает алгоритм, требующий немало вычислительных ресурсов. Речь идет о фильтре Гаусса – одной из самых популярных операций в области компьютерной обработки изображений.

