- BrainTools - https://www.braintools.ru -
Финальная модель Alibaba получила миллион токенов контекста, независимые оценки и очень серьёзную цену. Проверяем, что осталось от июльских обещаний и где всё ещё приходится ждать.
В июле я писал о предварительной версии Qwen3.8 Max. Тогда Alibaba показала модель на 2,4 трлн параметров и пообещала уровень сразу под Claude Fable 5. Проверить это было почти нечем: независимых тестов не было, модельной карточки тоже, цена отсутствовала, открытые веса жили в будущем времени.
3 августа вышла финальная Qwen3.8 Max. За неделю накопилось достаточно данных, чтобы вернуться к четырём скучным вопросам, которые обычно переживают презентацию: насколько модель сильна, сколько стоит, где доступна и можно ли её скачать.
Qwen3.8 Max представляет собой нативную мультимодальную модель со смесью экспертов и 2,4 трлн параметров. Она принимает текст, изображения и видео, возвращает текст и поддерживает контекст до миллиона токенов. В режиме мышления [1] доступно до 983 тысяч входных и 131 тысячи выходных токенов.
Миллион токенов вмещает примерно десять романов или несколько крупных репозиториев с документацией. Качество анализа зависит от самой модели и структуры материалов. Большой контекст снимает привычную инженерную возню с нарезкой документов, повторной подачей файлов и потерянными кусками контекста.
Гибридное мышление включено по умолчанию. Модель умеет вызывать функции, работать со встроенными инструментами и выдавать структурированный результат. Alibaba отдельно продвигает её для программирования и профессиональных агентных процессов. На странице модели встречается обещание проектов продолжительностью более десяти дней. Пока это заявление производителя, независимого воспроизведения такого марафона я не нашёл.
API уже работает в QwenCloud. Финальная версия перестала быть красивой вывеской в списке будущих релизов и стала продуктом, которому можно выставить счёт.
Artificial Analysis прогнала Qwen3.8 Max через собственный набор тестов. В широком Intelligence Index модель получила 58,1 балла. Claude Fable 5 набрала 62,1. Июльская формулировка про уровень сразу под Fable выглядит довольно точной: разрыв составил четыре балла.
В Agentic Index порядок меняется. Qwen3.8 Max получила 58,4 балла, Claude Fable 5 получила 56,6. Выше Qwen на момент проверки стояли только два режима Claude Opus 5. Этот индекс собирает задачи, где модель должна выполнить работу через инструменты: разбираться с терминалом, вести многошаговый процесс и доводить прикладную задачу до результата.
Получилась редкая аккуратная картина. Claude Fable 5 сильнее по широкому набору интеллектуальных задач. Qwen3.8 Max лучше прошла узкую агентную часть. Для чат-бота первая цифра важнее. Для системы, которая ходит по инструментам, правит файлы и выполняет длинную цепочку действий, вторая уже заслуживает отдельного теста.
Фирменные графики Alibaba рисуют модель ещё увереннее. Я бы оставил их в роли витрины: производитель выбирает тесты, режимы и соперников. Независимая оценка выглядит скромнее и потому полезнее.
Alibaba установила единую ставку: $2 за миллион входных токенов и $6 за миллион выходных. Чтение закэшированного контекста стоит $0,25 за миллион токенов.
У Claude Fable 5 официальная цена составляет $10 за вход и $50 за выход. Qwen обходится в пять раз дешевле на входе и примерно в 8,3 раза дешевле на выходе.
Возьмём агентный процесс, который за несколько часов съел 10 млн входных и 5 млн выходных токенов. По базовым ставкам он обойдётся в $50 на Qwen3.8 Max и в $350 на Claude Fable 5. Разница семикратная. Кэш, повторные вызовы и разное количество рассуждений изменят итоговый чек. Порядок цен уже виден без лупы.
Qwen3.8 Max заодно дешевле предыдущей Qwen3.7 Max. Та стоила $2,50 за вход и $7,50 за выход. Новая флагманская модель получила скидку в 20 процентов ещё до того, как успела состариться. В индустрии ИИ календарь иногда работает быстрее отдела продаж.
У цены есть мелкая бухгалтерская сноска. На полном прогоне Intelligence Index модель выдала около 150 млн токенов. Медиана сопоставимых моделей у Artificial Analysis составляет 66 млн. Qwen оказалась примерно в 2,3 раза многословнее медианы.
Сам тестовый прогон стоил лаборатории $1741. Сумма относится ко всему набору испытаний и ничего не говорит о цене одного обычного запроса. Она показывает характер модели: Qwen охотно тратит токены на рассуждение. В длинном агентном цикле часть экономии может уйти на дополнительные шаги и подробные внутренние монологи.
Скорость нормальная: около 82 выходных токенов в секунду через API Alibaba. Artificial Analysis измерила у Claude Fable 5 примерно 70 токенов в секунду. Первое появление ответа у Qwen занимает около 2,8 секунды. Для большой думающей модели это вполне рабочий темп.
3 августа команда Qwen написала, что открытые веса Qwen3.8 Max появятся на следующей неделе. Вместе с флагманом обещана Qwen3.8-27B, версия, которую заметно проще запускать вне больших облаков.
Утром 10 августа поиск по официальному аккаунту Qwen на Hugging Face не находил ни одного репозитория Qwen3.8. Формально обещанная неделя только началась. Текущий статус всё равно стоит записать точно: API и чат доступны, открытые веса пока обещаны.
Даже после публикации весов Qwen3.8 Max не превратится в модель для ноутбука. 2,4 трлн параметров занимают примерно 4,8 ТБ в BF16. Четырёхбитная версия потребует около 1,2 ТБ до накладных расходов. Такой локальный запуск начинается с серверной стойки и заканчивается разговором о счёте за электричество.
Для большинства разработчиков интереснее Qwen3.8-27B. Если обещание будет выполнено, именно эта версия сможет попасть на рабочие станции и в доступные GPU-серверы. Большой Max нужен исследователям, хостингам и компаниям с собственным кластером.
Модель выглядит разумным кандидатом для четырёх сценариев:
агентное программирование и работа с терминалом, где независимый индекс уже показывает сильный результат;
анализ очень длинных документов, репозиториев и видео в одном контексте;
многошаговые процессы с большим объёмом выходного текста, где цена Claude становится заметной статьёй расходов;
резервная модель рядом с Claude, чтобы сравнивать качество на собственных задачах и переключать подходящие запросы.
Слепая замена текущей модели всё ещё рискованна. Agentic Index сводит много задач к одному числу, а ваш продукт обычно упрямо состоит из конкретных документов, инструментов и странных пользовательских привычек. Нужен небольшой набор собственных тестов: успешность задачи, число шагов, время, расход токенов и стоимость исправления ошибок.
Финальная модель вышла и доступна через API.
Контекст в миллион токенов подтверждён документацией.
Цена оказалась ниже предыдущего флагмана и намного ниже Claude Fable 5.
Независимые тесты подтверждают высокий уровень. В общем индексе Fable впереди, в агентном Qwen впереди.
Открытые веса на утро 10 августа ещё не опубликованы.
Qwen3.8 Max уже заработала право на практический тест. Alibaba привезла модель верхнего уровня по цене, при которой агентные процессы перестают выглядеть как дорогая привычка. Теперь осталось дождаться весов и посмотреть, сможет ли открытый релиз превратить удачный API в большую экосистему. Календарь у команды Qwen пока открыт на нужной странице.
Автор: danil_makaroff
Источник [2]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/34206
URLs in this post:
[1] мышления: http://www.braintools.ru/thinking
[2] Источник: https://habr.com/ru/articles/1068706/?utm_campaign=1068706&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.