artificial analysis.

Qwen3.8 Max вышла: выше Claude Fable 5 в агентном индексе при цене $6 за миллион токенов

Финальная модель Alibaba получила миллион токенов контекста, независимые оценки и очень серьёзную цену. Проверяем, что осталось от июльских обещаний и где всё ещё приходится ждать.

продолжить чтение

Qwen3.8-Max: 2 400 000 000 000-параметровый монстр

Пока одни запускали GPT-5.6 Sol Max, другие ломали копья в холиварах «Kimi K3 vs Claude Opus 5», Alibaba тихо (ага, с ростом акций на 7% в моменте – очень тихо) вкатила модель, которую сама называет «новой планкой для кодинга и совместной работы». Знакомьтесь: Qwen3.8-Max

продолжить чтение

Gemini 3.6 Flash не стала умнее. Зато работает вдвое быстрее

21 июля Google выпустила сразу три модели: Gemini 3.6 Flash, облегчённую 3.5 Flash-Lite и специальную 3.5 Flash Cyber для задач кибербезопасности. У больших компаний календарь выпусков устроен как вокзальное табло: если смотреть достаточно долго, обязательно что-нибудь прибудет.В анонсе обещают улучшенный код, знания и работу с инструментами. Всё как положено. Но главное изменение обнаружилось там, куда торжественная музыка обычно не дотягивается: новая Flash тратит меньше токенов и заметно быстрее заканчивает длинные задачи.

продолжить чтение

Claude Opus 4.7 достиг 1-го места на Artificial Analysis

Artificial Analysis опубликовала результаты тестирования Claude Opus 4.7. Согласно отчёту, новая нейросеть разделила первое место в Индексе искусственного интеллекта (Artificial Analysis Intelligence Index) с GPT-5.4 (OpenAI) и Gemini 3.1 Pro (Google), набрав 57,3 балла против 57,2 и 56,8. С учётом погрешности в ±1 балл эксперты заявляют о трёхсторонней ничьей – впервые в истории платформы.

продолжить чтение

Xiaomi выпустила MiMo-V2-Flash 309B, модель достигла абсолютного верха в агентном бенчмарке

Китайский гигант Xiaomi представил MiMo‑V2-Flash — большую языковую модель с открытыми весами, которая претендует на лидерские позиции в конкретных дисциплинах.

продолжить чтение