Команда Qwen представила Qwen3.8-Omni‑Flash — новую мультимодальную модель. Главный акцент в новой версии сделали на понимании видео. Qwen3.8-Omni‑Flash умеет анализировать длинные ролики, составлять по ним подробные отчёты и генерировать описания содержимого. В Qwen отдельно отмечают улучшение работы с временными метками: модель должна точнее связывать события с конкретными моментами видео.
При этом текстовые возможности модели сохранили на уровне Qwen3.8-Flash. В API также доступны function calling и веб‑поиск, а режим рассуждений включён по умолчанию и может настраиваться через reasoning_effort.
Qwen3.8-Omni‑Flash — промежуточное звено для более сложных мультимодальных пайплайнов. Среди возможных сценариев разрабы называют монтаж видео, перевод, создание кинокомментариев, анализ и генерацию контента.
Отдельный фокус релиза — стоимость. По сравнению с предыдущей Qwen3.5-Omni‑Flash расход токенов при работе с мультимодальными данными заметно снизился. В частности, Qwen заявляет о снижении стоимости обработки аудио примерно на 98%, а аудио‑видео — более чем на 93%. При этом заявленная производительность сопоставима с Gemini 3.8 Flash. Независимые данные также показывают снижение расхода токенов на одном из видеобенчмарков: с 145 736 до 79 117 токенов при росте результата OmniVideoBench с 63,4 до 67,8.
Контекстное окно новой модели — 1 млн токенов, максимальная длина генерируемого ответа — 131 072 токена. Qwen3.8-Omni‑Flash принимает текст, изображения, аудио и видео, а на выходе генерирует текст.
Модель уже доступна через API и в интерфейсе Qwen. Для API поддерживаются Chat Completions и Responses, включая OpenAI‑совместимый формат запросов.
Автор: DashaPasha


