- BrainTools - https://www.braintools.ru -

Новые ИИ-модели и LLM недели: Qwen3.8-Flash-Next, GLM-5.3, Granite 4.2, Hy4 и новые модели для видео, речи и изображений

С 24 по 31 августа разработчики выпустили сразу несколько заметных ИИ-моделей и LLM. В числе главных релизов недели — новая архитектура Qwen3.8-Flash-Next, мультимодальная GLM-5.3-Flash и публикация весов основной GLM-5.3, Granite 4.2 от IBM, Hy4 preview от Tencent и первая собственная LLM Thomson Reuters.

Параллельно обновились модели для генерации видео, изображений и речи. Alibaba выпустила Wan 3.0, Bria AI — Fibo 1.5, а в speech-направлении появились Gemini 3.5 Transcribe, FireRedTTS3, Breeze TTS 2 и Sopro V2 Turbo. Ниже — главные релизы новых нейросетей и обновления AI-моделей за последнюю неделю августа.

Новые LLM и мультимодальные языковые модели

Thomson — собственная LLM от Thomson Reuters

Thomson Reuters представила Thomson — первую собственную большую языковую модель компании.

Вместо попытки конкурировать с крупнейшими универсальными моделями по числу параметров компания сделала ставку на специализированную LLM, обученную с использованием собственных профессиональных данных и экспертизы. На разработку Thomson Reuters направила $40 млн.

Модель предназначена для юридических, налоговых, аудиторских и других профессиональных сценариев. Компания подчёркивает, что полностью контролирует Thomson и её эксплуатацию, а сама модель рассчитана на существенно меньшую стоимость работы по сравнению с сопоставимыми frontier-моделями.

Thomson [1]

Apodex 1.1 — LLM для многошаговых агентских задач

В конце августа обновилось семейство Apodex 1.1, ориентированное на сложные автономные задачи.

Основной акцент разработчики делают не на обычном диалоге, а на сценариях, где модели нужно последовательно анализировать информацию, работать с файлами, кодом и внешними инструментами и доводить задачу до результата.

В линейке есть и open-weight версия Apodex 1.1 mini на 35 млрд параметров. Семейство позиционируется как agentic-модель для длинных рабочих цепочек, а не как обычный чат-бот.

Granite 4.2 — IBM добавила нативный reasoning

IBM представила Granite 4.2 — новое семейство открытых reasoning-моделей в трёх размерах: 3B, 8B и 30B параметров.

Главное изменение по сравнению с предыдущим поколением — встроенный режим reasoning. Модели умеют выполнять многошаговые рассуждения, работать с инструментами, решать задачи по программированию и использовать reasoning в агентских сценариях.

При этом IBM сознательно оставила семейство относительно компактным: версии Granite 4.2 рассчитаны не только на облачные сервисы, но и на локальный запуск и корпоративную инфраструктуру.

Granite 4.2 [2]

Qwen3.8-Flash-Next — preview архитектуры следующего поколения Qwen

Alibaba открыла веса Qwen3.8-Flash-Next.

Это мультимодальная MoE-модель и одновременно ранний preview архитектуры, которую разработчики планируют использовать в следующем поколении Qwen. Команда специально открыла модель до появления полноценной новой линейки, чтобы показать архитектурные изменения и дать сообществу возможность их исследовать.

Qwen3.8-Flash-Next получила изменения сразу в нескольких компонентах архитектуры — attention, residual, embedding и оптимизации. Задача релиза — сохранить большую ёмкость модели, одновременно снижая вычислительные затраты.

Это один из наиболее интересных open-weight релизов недели именно с исследовательской точки зрения [3].

Qwen3.8-Flash-Next [4]

Ссылки

GLM-5.3 и GLM-5.3-Flash

На этой же неделе Z.ai [9] представила GLM-5.3-Flash. Модель стала мультимодальной: она работает с текстом, изображениями и видео. Архитектура использует sparse-механизмы, благодаря чему при общем размере около 320 млрд параметров на каждый токен активируется только около 18 млрд. Она ориентирована прежде всего на агентские и coding-сценарии, а также на работу с длинным контекстом.

GLM-5.3-Flash [10]

Следом Z.ai [9] опубликовала веса GLM-5.3. Таким образом, за одну неделю обновилась сразу основная модель семейства и её более экономичная Flash-версия.

GLM-5.3 [11]

Hy4 preview — 770 млрд параметров от Tencent

Tencent выпустила и открыла веса Hy4 preview. Это MoE-модель с 770 млрд параметров, из которых 49 млрд активны на токен. Контекстное окно превышает 1 млн токенов.

Tencent позиционирует Hy4 как модель для программирования, офисной работы и научных задач. В отличие от многих экспериментальных open-weight моделей, разработчики изначально делают упор на длительные agentic-сценарии и реальную работу с большими объёмами контекста.

Hy4 preview [12]


Новые модели для генерации видео

Wan 3.0 — новая видеомодель Alibaba

Это мультимодальная видеомодель, которая объединяет генерацию видео, работу с изображениями и референсами, редактирование и продолжение сцен в рамках одной модели. Wan 3.0 поддерживает генерацию видео до 30 секунд и варианты вывода от 480p до 1080p.

Заявленная стоимость стандартной версии начинается от $0,05 за секунду для 480p, $0,10 для 720p и $0,20 для 1080p.

Wan 3.0 [13]

MiniMax H3 Max — ускоренная версия видеомодели

В конце недели появилась MiniMax H3 Max — пост-трейн версия MiniMax H3, ориентированная на более быструю генерацию видео.

Для модели заявлены генерация пятisekундного 768p-ролика примерно за три секунды и сниженная стоимость инференса. В отличие от исходной H3, H3 Max делает ставку прежде всего на скорость и быстрые итерации.

MiniMax H3 Max [14]

MiniMax-H3 × Z-Image — улучшенная детализация видео

Появилась производная версия MiniMax-H3 × Z-Image, в которой разработчики попытались перенести сильные стороны Z-Image в работе с текстурами в видеогенерацию H3.

Главное изменение заметно на мелких деталях: поверхности, лица, растительность и другие текстурные элементы должны выглядеть более детализированными, при этом базовые свойства MiniMax H3 сохраняются.

MiniMax-H3 × Z-Image [15]

InfinityEdit — модель для последовательного редактирования видео

InfinityEdit от Zhejiang University и Alibaba Group решает другую задачу — последовательное редактирование видео текстовыми командами.

После каждой команды модель продолжает работать с уже изменённой сценой, а не начинает генерацию заново. Это позволяет выстраивать длинную цепочку правок, не разрывая исходное видео.

InfinityEdit [16]

VideoNeuMat — нейронные материалы из генеративных моделей

VideoNeuMat от NVIDIA и University of Manchester превращает знания видеогенеративных моделей о внешнем виде объектов в отдельное представление материала.

На вход можно подать текст или изображение, а на выходе получить нейронный материал, который отделён от конкретной геометрии и освещения. Такой подход рассчитан уже не столько на генерацию видео, сколько на дальнейшее использование материалов в 3D.

VideoNeuMat [17]


Новые модели для генерации изображений

Fibo 1.5 — генерация изображений за 4–6 шагов

Bria AI обновила модель Fibo 1.5. Вместо десятков шагов новая версия использует дистилляцию и генерирует изображение за 4–6 шагов без classifier-free guidance. При этом сохраняется главное преимущество семейства FIBO — структурированное JSON-native управление сценой.

Разработчики заявляют улучшение реализма и качества текстур при существенном сокращении количества шагов инференса. Релиз датирован 24 августа.

Fibo 1.5 [18]

SenseNova U1.5 Lite

SenseNova обновила мультимодальную модель U1.5 Lite. В новой версии улучшены генерация изображений, следование сложным инструкциям и работа с текстом. Также заявлена поддержка нативного 4K и более точного редактирования с сохранением исходного изображения.

SenseNova U1.5 Lite [19]


Модели для речи и голоса

Gemini 3.5 Transcribe — интеллектуальная транскрипция

Google представила Gemini 3.5 Transcribe — новую speech-to-text модель. В отличие от классических систем распознавания речи она сразу превращает сырой аудиопоток в очищенный и структурированный текст: модель умеет убирать слова-паразиты и самоперебивы, учитывать контекст и автоматически форматировать результат.

Google заявляет поддержку более 85 языков, включая региональные варианты произношения, и работу в реальном времени.

Gemini 3.5 Transcribe [20]

FireRedTTS3 — клонирование и редактирование голоса

FireRedTTS3 — третье поколение TTS-модели FireRed Team. Она объединяет несколько задач в одной системе: zero-shot клонирование голоса, управление характеристиками голоса по текстовой инструкции и редактирование уже сгенерированной речи.

Модель поддерживает 24 языка, включая русский. Для клонирования достаточно короткого аудиореференса.

FireRedTTS3 [21]

Breeze TTS 2 — realtime TTS

Breeze TTS 2 — новая модель синтеза речи, ориентированная на работу в реальном времени. Она поддерживает клонирование голоса, управление манерой речи по инструкции и специальные голосовые события. Разработчики заявляют задержку до первого аудио менее 40 мс и скорость генерации до трёх раз выше реального времени.

Breeze TTS 2 [22]

Sopro V2 Turbo — 120 млн параметров и работа на CPU

Sopro V2 Turbo выделяется минимальным размером — всего около 120 млн параметров. Модель умеет клонировать голос по короткому образцу и работает непосредственно на устройстве. Разработчики заявляют первый звук примерно через 300 мс на обычном ноутбучном CPU и генерацию до пяти раз быстрее реального времени.

Sopro V2 Turbo [23]


Embeddings и специализированные AI-модели

GigaEmbeddings — новое поколение embeddings от Сбера

Сбер представил три модели семейства GigaEmbeddings: на 480 млн, 3 млрд и 10 млрд параметров с 1,8 млрд активных параметров. Это не генеративные LLM, а модели представления текста для семантического поиска, RAG, классификации и кластеризации.

Особенно интересна крупная версия 10B-A1.8B: она заняла первое место в ruMTEB. Более компактные модели также получили заметные улучшения по скорости и качеству русского языка.

GigaEmbeddings [24]


Какие модели стали доступны на BotHub

В конце лета на платформе BotHub появились и стали доступны для работы ещё несколько актуальных моделей для текста, изображений и видео.

Среди них:

  • Seedance 2.0 [25] и Seedance 2.5 [26] — модели для генерации видео;

  • Seedream 4.5 [27] — модель для генерации изображений;

  • Kimi K2.6 [28] и Kimi K3 [29] — большие языковые модели;

  • GLM-5.3 [30]— языковая модель семейства GLM;

  • MiniMax-M3 [31] — большая языковая модель MiniMax;

  • Mistral Medium 3.5 [32] — новая версия LLM от Mistral;

  • GPT-OSS-120B [33] — открытая большая языковая модель;

  • Wan 2.7 [34] — видеомодель семейства Wan;

  • Gemini 3.7 Flash [35]— быстрая версия мультимодальной модели Google.

Что успели протестировать? Как вам релизы конца августа?

Автор: DashaPasha

Источник [36]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/34922

URLs in this post:

[1] Thomson: https://www.thomsonreuters.com/en/press-releases/2026/august/thomson-reuters-leverages-its-world-class-data-assets-to-launch-its-own-frontier-model

[2] Granite 4.2: https://d3ccyth396mz21.cloudfront.net/blog/introducing-granite-4-2

[3] зрения: http://www.braintools.ru/article/6238

[4] Qwen3.8-Flash-Next: https://github.com/QwenLM/Qwen3.8-Flash-Next

[5] huggingface : https://huggingface.co/Qwen/Qwen3.8-Flash-Next

[6] quantized: https://huggingface.co/models?other=base_model:quantized:Qwen/Qwen3.8-Flash-Next

[7] Демо: https://huggingface.co/spaces/bored10/qwen3-8-flash-next-demo

[8] API: https://www.qwencloud.com/

[9] Z.ai: http://Z.ai

[10] GLM-5.3-Flash: https://z.ai/blog/glm-5.3-flash

[11] GLM-5.3: https://huggingface.co/zai-org/GLM-5.3

[12] Hy4 preview: https://hy.tencent.ai/research/hy4-preview

[13] Wan 3.0: https://wan.video/

[14] MiniMax H3 Max: http://x.com/fal/status/2092710676431020376

[15] MiniMax-H3 × Z-Image: https://huggingface.co/joeygambino/MiniMax-H3-x-Z-Image-native/tree/main

[16] InfinityEdit: https://yunzetong.github.io/InfinityEdit/

[17] VideoNeuMat: https://bowenxueai.github.io/VideoNeuMat/

[18] Fibo 1.5: https://huggingface.co/briaai/Fibo-1.5

[19] SenseNova U1.5 Lite: https://github.com/OpenSenseNova/SenseNova-U1

[20] Gemini 3.5 Transcribe: http://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

[21] FireRedTTS3: https://fireredteam.github.io/demos/firered_tts_3/

[22] Breeze TTS 2: https://breezeblue.ai/breeze-tts-2

[23] Sopro V2 Turbo: https://research.haloneuro.ai/posts/sopro-v2

[24] GigaEmbeddings: https://huggingface.co/collections/ai-sage/giga-embeddings

[25] Seedance 2.0: https://bothub.ru/seedance-2.0

[26] Seedance 2.5: https://bothub.ru/seedance-2.5

[27] Seedream 4.5: https://bothub.ru/seedream-4.5

[28] Kimi K2.6: https://bothub.ru/kimi-k2.6

[29] Kimi K3: https://bothub.ru/kimi-k3

[30] GLM-5.3 : https://bothub.ru/glm-5.3

[31] MiniMax-M3: https://bothub.ru/minimax-m3

[32] Mistral Medium 3.5: https://bothub.ru/mistral-medium-3-5

[33] GPT-OSS-120B: https://bothub.ru/gpt-oss-120b

[34] Wan 2.7: https://bothub.ru/wan-2.7

[35] Gemini 3.7 Flash : https://bothub.ru/gemini-3.7-flash

[36] Источник: https://habr.com/ru/companies/bothub/news/1076710/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1076710

www.BrainTools.ru

Rambler's Top100