Terminal-Bench.

DeepSeek V4.1-Flash: новая архитектура, 552 млрд параметров и агентные тесты

DeepSeek вывела V4.1-Flash — младшую модель новой архитектурной линейки компании. Это MoE-модель на 552 млрд параметров с нативной поддержкой изображений, контекстом до 1 млн токенов и отдельными режимами reasoning.Наиболее интересная часть релиза — архитектурные изменения. DeepSeek перешла к асимметричной схеме Causal Encoder–Decoder: при prefill активируется около 8 млрд параметров на токен, а при decode — 16 млрд. То есть вычислительный бюджет для обработки входа и генерации намеренно сделали разным.

продолжить чтение

Z.ai выпустили GLM-5.3: обошла Opus 4.8, но уступила Fable 5 и GPT-5.6 Sol

Z.ai выпустили GLM-5.3, новую модель для программирования и долгих агентных задач.GLM-5.3 использует ту же базовую модель, что и GLM-5.2. Компания не меняла архитектуру и не проводила новый претрейн. Изменения внесли на этапе пост-тренинга: в течение месяца модель обучали с подкреплением на дополнительных рабочих окружениях.На Terminal-Bench 3.0 результат вырос с 4,6% до 28,3%, на DeepSWE — с 46,2% до 66,9%. Веса обещают открыть через две недели, после дополнительной проверки безопасности.

продолжить чтение

Alibaba выпустили Qwen3.8-Max: стоит в четыре раза дешевле Opus 5, но уступает в сложном кодинге

Команда Qwen выпустила Qwen3.8-Max, новую флагманскую MoE-модель на 2,4 трлн параметров. На каждом токене активируются 95 млрд параметров, размер контекста составляет 1 млн токенов.

продолжить чтение

Как тестируют кодинг-агентов в 2026 — и почему вашему продакшну нужен свой бенчмарк

Ни для кого не секрет, что эра «спросить что-то у GPT» постепенно уходит в прошлое. На смену генеративному AI приходит Agentic AI, который не просто проконсультирует, а по вашему запросу придёт и сделает все сам. То же самое и с кодовыми агентами, они не просто отвечают на вопросы,  они читают документацию, работают в терминале, дёргают API, правят файлы и в идеале закрывают задачу целиком, от тикета до мёрж-реквеста.

продолжить чтение

Разбираем 14 самых популярных бенчмарков для LLM

Opus 4.5 набирает 80.6% на SWE-bench Verified. Opus 4 — 72.5%. Значит ли это, что Opus 4.5 лучше программирует, чем Opus 4?Ну... возможно. Но SWE-bench Verified это не показывает. Он показывает способность модели чинить небольшие баги в 12 популярных open source Python-репозиториях, которые почти наверняка входят в её обучающие данные. SWE-bench Verified не тестирует умение ориентироваться в вашем TypeScript-монорепо, Spring Boot-приложении или самописном ORM, на котором настоял предыдущий CTO.

продолжить чтение

Alibaba выкатили Qwen3.6-Plus — новый флагман серии Qwen

Модель появилась на OpenRouter в ночь с 30 на 31 марта как бесплатный превью без анонса и пресс-релиза: один твит от исследователя Qwen с таблицей бенчмарков — и всё. За первые два дня через неё прошло 400 млн completion-токенов в ~400 тыс. запросах.Контекстное окно по умолчанию — 1 млн токенов. На Terminal-Bench 2.0 модель набрала 61.6 против 59.3 у Claude 4.5 Opus, на OmniDocBench v1.5 — 91.2 против 87.7. На SWE-bench Verified пока отстаёт: 78.8 против 80.9 у Claude. 

продолжить чтение