- BrainTools - https://www.braintools.ru -

Сегодня команда Qwen выпустила третье поколение нейросети для генерации изображений — Qwen-Image-3.0. Разработчики заявили о смене вектора развития: если Qwen-Image 1.0 выходила со слоганом «Точность», а Qwen-Image 2.0 под идей «Разнообразия и красоты», то главный фокус версии 3.0 — концепт «Реальность».
Продукт позиционируют уже не как генератор красивых картинок, а как прикладной рабочий инструмент для верстки, создания UI-макетов, раскадровок и научных иллюстраций.
Главный прецедент релиза — отказ от открытой политики. Alibaba впервые не опубликовала технический отчет, независимые бенчмарки и веса модели. Инструмент заперт внутри Qwen Chat, а все заявленные возможности подтверждаются только рекламными демонстрациями самой компании.
Разработчики делят возможности модели на три инженерных блока.
Модель принимает инструкции длиной до 4 500 токенов (против ~1 000 у Qwen-Image 2.0). Такой объем памяти [1] позволяет описывать в одном запросе сразу множество независимых деталей.
Разработчики утверждают, что нейросеть способна за один раз генерировать сложные композиции — например, собрать на одной картинке десяток разных инфографик или отрисовать многоуровневые макеты, где интерфейсы логично [2] вложены друг в друга (скажем, открытое окно мессенджера внутри редактора кода).
Модель правильно рендерит мелкий текст размером до 10 пикселей, а также страницы научных статей с плотной многострочной версткой LaTeX (дроби, интегралы, индексы).
Модель нативно поддерживает 12 языков (включая испанский, корейский и японский) и 20+ шрифтов, умеет запрашивать актуальные данные из интернета (например, визуализирует прогноз погоды) и генерировать изображения известных персонажей поп-культуры (например, пикачу или марио).
Чтобы понять масштаб, необходимо посмотреть на результаты прошлого поколения.
Ранее компания опиралась на Qwen-Image-Bench — бенчмарк, созданный совместно с профессиональными художниками. В нем проводилась комплексная оценка 18 передовых моделей генерации изображений (включая GPT Image 2, Nano Banana Pro, Seedream 5.0 и другие).
Предыдущий флагман компании, Qwen Image 2.0 Pro, показал следующие результаты:
Модель заняла 5-е место в общем рейтинге с баллом 57,84;
В распределении на 5 лиг (Tier 1 – Tier 5) модель возглавила третью группу (Tier 3);
Нейросеть показала уверенную базу без явных уязвимостей, продемонстрировав результаты на уровне или выше среднего по индустрии практически по всем узким критериям оценки;
Абсолютным лидером тогда стала модель GPT Image 2, набравшая 64,69 балла и занявшая первые места во всех пяти ключевых категориях бенчмарка. Второе место удерживала Nano Banana 2.0 с баллом 59,82.
Наибольший разрыв между Qwen Image 2.0 Pro и лидерами наблюдался в прикладных дисциплинах — эстетике и креативной генерации.
Вот, например, как нейросеть теперь генерирует животных. Видно, что фон размыт совсем как при реальной съемке на светосильный объектив, а текстура шерсти и блики в глазах выглядят максимально естественно.
А это тот самый заявленный стресс-тест для верстки. Модель выдала целую страницу несуществующей научной статьи — с мелким плотным текстом, сложными многострочными формулами и адекватной структурой документа.
Ну и куда без портретов. Здесь хорошо видно, как Qwen справляется со сложным освещением: резкая тень от цветка ложится на лицо по всем законам физики, а детализация кожи и мелких волосков не выдает привычное «ИИ-мыло».
Если прошлое поколение — Qwen Image 2.0 Pro — уже входило в уверенный топ-5 индустрии и обеспечивало надежную базу, то кратный рост контекстного окна до 4 500 токенов и фокус на микродетализации текста в версии 3.0 могут дать Alibaba техническое преимущество, способное превзойти лидеров уровня GPT Image 2.
Новая модель выглядит как идеальный рабочий вариант, закрывающий недочеты конкурентов при работе с длинными инструкциями. Однако на фоне резкой смены политики с прозрачной на закрытую обнуляет возможность верифицировать этот прогресс. Без публикации открытых тестов статус Qwen-Image-3.0 как нового лидера рынка остается исключительно маркетинговым заявлением.

Каталог готовых ИИ-моделей
Сервис для запуска и управления LLM в облаке Selectel. Выберите модель, конфигурацию и получите готовый эндпоинт для работы с ней.
Подробнее → [5]
Автор: techno_mot
Источник [6]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/33332
URLs in this post:
[1] памяти: http://www.braintools.ru/article/4140
[2] логично: http://www.braintools.ru/article/7640
[3] Источник: https://huggingface.co/datasets/Qwen/Qwen-Image-Bench
[4] Источник: https://qwen.ai/blog?id=qwen-image-3.0
[5] Подробнее →: https://selectel.ru/services/cloud/foundation-models-catalog/?utm_source=habr.com&utm_medium=referral&utm_campaign=fmc_news_qwen-image-3_210726_banner_ord
[6] Источник: https://habr.com/ru/companies/selectel/news/1061474/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1061474
Нажмите здесь для печати.