диффузионные языковые модели.

Диффузионные языковые модели: как устроены, что в них работает, а что вызывает вопросы

Привет, Хабр. На связи команды «Интерпретируемый ИИ» и «Основы генеративного ИИ» AIRI и «Генеративная поэзия» SberAI. Мы занимаемся альтернативными архитектурами языковых моделей — тем, что могло бы работать вместо привычной генерации токен за токеном слева направо.Одно из таких направлений — диффузионные языковые модели (dLLM). Диффузионные языковые модели, в отличие от обычных LLM, генерируют текст параллельно, несколько токенов за раз. Теоретически это даёт кратное ускорение. Также они не ограничены генерацией справа от контекста и могут заполнять произвольные пропуски в поданном на вход тексте.

продолжить чтение