Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает full attention
Гибридные модели обещают простую вещь. Память под контекст перестаёт расти линейно с его длиной, значит длинный контекст дешевеет, значит на ту же карту влезает больше пользователей. Звучит настолько разумно, что проверять как-то неловко.Я всё-таки проверил, потому что интересовало как эта архитектура будет вести себя под нагрузкой и вписываться в существующий стек инференса. Снял на вечер машину с двумя RTX 3090 и прогнал по двум моделям одну и ту же агентскую нагрузку. Qwen3-4B: обычная, полная аттеншн во всех 36 слоях. Qwen3.5-4B: гибридная, полная аттеншн осталась в 8 слоях из 32, а остальные 24 заменены на рекуррентные слои Gated DeltaNet (
Mamba: архитектура, которая шла убивать трансформеры
В декабре 2023 по ML-тусовке прокатилась волна заголовков в духе «трансформерам конец». Поводом стала статья двух исследователей — Альберта Гу и Три Дао — со скучным названием:
Пора переезжать на локальные LLM. Или нет?
Нет большой разницы в инструментах, когда речь идет о создании простеньких чат-ботов. Но когда вы работаете над продуктом посерьезнее, например создаете сложного AI-агента или работаете с чувствительными данными, облачные LLM начинают выставлять счета. И не только финансовые.Что если переход на локальную инфраструктуру (вроде Ollama) это решение, которое не просто поможет сэкономить, но изменит саму динамику разработки?Налог на итерацию

