dllm.

Диффузионная LLM технически умеет глушить свой контекст. Я попробовал этим воспользоваться

У авторегрессионной модели контекст — это то, что уже случилось. Токен выдан, и переписать его нечем: генерация умеет только дописывать справа.У диффузионной всё иначе. На каждом шаге она делает полный двунаправленный проход по всей последовательности и переоценивает каждую позицию. Решение «эту фиксируем, эту оставляем открытой» принимает встроенный механизм уверенности: прошёл максимум softmax порог — токен приморожен, не прошёл — остаётся маской и будет переписан. То есть у диффузионной модели структурно есть

продолжить чтение

Диффузионные языковые модели: как устроены, что в них работает, а что вызывает вопросы

Привет, Хабр. На связи команды «Интерпретируемый ИИ» и «Основы генеративного ИИ» AIRI и «Генеративная поэзия» SberAI. Мы занимаемся альтернативными архитектурами языковых моделей — тем, что могло бы работать вместо привычной генерации токен за токеном слева направо.Одно из таких направлений — диффузионные языковые модели (dLLM). Диффузионные языковые модели, в отличие от обычных LLM, генерируют текст параллельно, несколько токенов за раз. Теоретически это даёт кратное ускорение. Также они не ограничены генерацией справа от контекста и могут заполнять произвольные пропуски в поданном на вход тексте.

продолжить чтение

Вышел Mercury Coder: первая модель на принципиально новой архитектуре dLLM, в 10 раз быстрее LLM

продолжить чтение