qwen3.

300 классов, 400 сэмплов и никакого промптинга: ЛЛМ как энкодер для классификации

Когда речь заходит о ЛЛМ и классификации, первая мысль — попросить модель сгенерировать класс через промптирование модели с описанием правил и добавлением примеров. Для небольшого количества классов это работает. Но для 100+ классов (или даже 20-30) — уже нет: контекст раздувается, модель галлюцинирует, а инференс может занимать десятки секунд. Мы решили использовать ЛЛМ иначе: не как генератор текста, а как энкодер, прикрутив сверху обычную классификационную голову.

продолжить чтение

Спекулятивное декодирование: от чего на самом деле зависит ускорение

Языковая модель пишет ответ по одному токену за шаг, и на каждом шаге прочитывает все свои веса от начала до конца. Спекулятивное декодирование пытается это обойти: маленькая черновая модель набрасывает несколько токенов вперёд, причём сразу деревом вариантов, а большая проверяет всё это дерево за один свой проход и принимает ту ветку, которая совпала с её собственным выбором. Текст на выходе получается тот же самый, быстрее становится только его получение. Так устроен метод из статьи EAGLE-3 с NeurIPS 2025, и авторы приводят для него ускорение до 6.5 раза.

продолжить чтение

How we choose LLMs and frameworks for AI agents

продолжить чтение

Промпт, RAG или дообучение: что реально выучит вашу LLM

Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про эксперимент, который я давно хотел провести честно, а не на слайдах. Ситуация, думаю, знакома многим: вы подняли локальную модель для внутренних задач — и первый же вопрос про ваш домен она уверенно завалила. У нас она придумала несуществующий код ответа

продолжить чтение

Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает full attention

Гибридные модели обещают простую вещь. Память под контекст перестаёт расти линейно с его длиной, значит длинный контекст дешевеет, значит на ту же карту влезает больше пользователей. Звучит настолько разумно, что проверять как-то неловко.Я всё-таки проверил, потому что интересовало как эта архитектура будет вести себя под нагрузкой и вписываться в существующий стек инференса. Снял на вечер машину с двумя RTX 3090 и прогнал по двум моделям одну и ту же агентскую нагрузку. Qwen3-4B: обычная, полная аттеншн во всех 36 слоях. Qwen3.5-4B: гибридная, полная аттеншн осталась в 8 слоях из 32, а остальные 24 заменены на рекуррентные слои Gated DeltaNet (

продолжить чтение

Как я объединил четыре Mac Studio в один компьютер с 1,5 ТБ – и запустил ИИ, который не влезает ни в одну видеокарту

Компания Apple предоставила мне этот кластер из Mac Studio для тестирования технологии RDMA через Thunderbolt –

продолжить чтение

Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM

Началось всe с очень приземленной задачи. У меня ноутбук с RTX 3050 и четырьмя гигабайтами видеопамяти, и я хочу гонять на нeм маленькую модель, которая умеет вызывать инструменты: заполнять JSON по схеме, выбирать нужную функцию, не звать еe там, где не надо. Чтобы модель влезла, еe приходится квантовать, и вот тут возникает вопрос, на который я так и не нашeл честного ответа: насколько сильно квантование ломает именно способность к вызову инструментов, а не абстрактное «качество» модели.

продолжить чтение

Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall

В прошлой статье мы разбирали, почему retrieval в 2026 переехал с энкодеров на декодерные LLM: Qwen3-Embedding, NV-Embed, E5-Mistral эмбеддят лучше BGE, держат 32k контекста и понимают инструкции в промпте.Проблема простая. Декодерный эмбеддер 7–8B действительно дает качество. Но за это качество вы платите трижды: память (8B в fp16 - не только веса модели, но и жирные векторы в индексе), latency (forward-pass большой модели) и деньги (GPU под нагрузкой или счет за эмбеддинг-API). И если latency лечится инференс-стеком (SGLang, батчинг - тема будущей статьи серии), то стоимость

продолжить чтение

Retrieval в 2026: как RAG переехал с энкодеров на LLM (и что с этим делать в своём проекте)

продолжить чтение

Как использовать новые Qwen3.7 Plus в России и GLM 5.2 на русском

Qwen3.7 Plus от Alibaba и GLM 5.2 от Z.AI теперь работают без VPN. Обе заточены под кодинг и агентные задачи, обе держат миллион токенов контекста, и обе могут вам пригодиться. Как получить к ним доступ без подписок и сервисов обхода, разбираемся в этой статье.Qwen3.7 Plus: мультимодальный агент за копейкиQwen3.7 Plus — это мультимодальная версия агентного бэкбона Qwen3.7 примерно в шесть раз дешевле, чем флагманский Qwen3.7 Max.

продолжить чтение