Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами. anthropic.. anthropic. claude fable 5.. anthropic. claude fable 5. Claude Opus 5.. anthropic. claude fable 5. Claude Opus 5. GPT-5.6 Sol.. anthropic. claude fable 5. Claude Opus 5. GPT-5.6 Sol. IT-компании.. anthropic. claude fable 5. Claude Opus 5. GPT-5.6 Sol. IT-компании. llm.. anthropic. claude fable 5. Claude Opus 5. GPT-5.6 Sol. IT-компании. llm. бенчмарки.. anthropic. claude fable 5. Claude Opus 5. GPT-5.6 Sol. IT-компании. llm. бенчмарки. Блог компании GPTunneL.. anthropic. claude fable 5. Claude Opus 5. GPT-5.6 Sol. IT-компании. llm. бенчмарки. Блог компании GPTunneL. Информационная безопасность.. anthropic. claude fable 5. Claude Opus 5. GPT-5.6 Sol. IT-компании. llm. бенчмарки. Блог компании GPTunneL. Информационная безопасность. искусственный интеллект.. anthropic. claude fable 5. Claude Opus 5. GPT-5.6 Sol. IT-компании. llm. бенчмарки. Блог компании GPTunneL. Информационная безопасность. искусственный интеллект. Машинное обучение.
Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами - 1

Полтора месяца все обсуждали Fable 5. Её выпустили 9 июня, через три дня отключили по требованию Минторга США (экспортные ограничения, что-то про уязвимость в защите), а 30 июня вернули обратно, но уже без места в обычной подписке. Кто следил за новостями, помнит эти качели: анонс года, внезапная пауза, потом тихое возвращение. Ощущение осталось смешанное – модель топовая, а трогать её разрешалось немногим.

И вот 24 июля Anthropic выкатывает Claude Opus 5. Дешевле вдвое, доступна сразу всем. А по независимому рейтингу Artificial Analysis обошла саму Fable 5 – совсем немного, но обошла. Как будто кто-то в компании посмотрел на весь этот цирк с санкциями и решил: ладно, сделаем модель, о которой не придётся оправдываться регуляторам.

Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами - 2

Гонка, в которой никто не успевает выдохнуть

Чтобы понять, почему Opus 5 вообще случилась именно сейчас, нужно вспомнить темп последних месяцев.

Anthropic выпустила четыре модели меньше чем за два месяца: Mythos 5 и Fable 5–9 июня, Sonnet 5 – 30 июня, и вот теперь Opus 5 – 24 июля. Для индустрии, где привычно одна модель жила флагманом год, это уже что-то похожее на конвейер.

Смысл в этой спешке, на самом деле, простой. Раньше лаборатории соревновались в том, что лучшая модель может сделать в свой лучший день – на самом сложном бенчмарке, в самой эффектной демке. Теперь конкуренция сместилась в такую сторону: что очень хорошая модель может делать каждый день, за вменяемую цену. Тот самый средний слой сложности, где живёт 90% реальной работы, а не разовые подвиги.

Именно поэтому Opus 5 – это не «Opus 4.9», а полноценное пятое поколение с новым номером. Anthropic сама формулирует без двусмысленностей: модель «приближается к передовому интеллекту Claude Fable 5 – за половину ее цены».

Что вообще такое Opus 5

Это старшая массовая модель линейки Claude, стоящая между Sonnet 5 и закрытой парой Fable 5/Mythos 5. На вход она принимает текст, изображения и файлы; на выход выдаёт текст (картинок, аудио, видео она не рисует) или выполняет агентные задачи.

Контекстное окно – 1 000 000 токенов, и это одновременно значение по умолчанию и потолок. Меньшего варианта попросту нет. Максимум генерируемого аутпута – 128 000 токенов. Режим рассуждений включен по умолчанию (и это уже давно в Claude) – модель проводит внутреннюю проработку задачи, прежде чем ответить. Глубина проработки регулируется параметром усилий (effort).

Бенчмарки: где отрыв настоящий

Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами - 3

Часть цифр с презентации – это внутренние метрики Anthropic; Frontier-Bench, GDPval-AA – никто снаружи их не воспроизводил. Часть – независимые замеры других компаний, вроде индекса Artificial Analysis.

Разложим их по отдельности.

Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами - 4

По собственным замерам Anthropic картина выглядит эффектно.

  • На Frontier-Bench v0.1 (тесте на агентное программирование в терминале) Opus 5 набирает 43,3%, притом что предыдущий Opus 4.8 показывал 18,7%, а Fable 5 – 33,7%. Это более чем вдвое сильнее предшественника и заметно выше собственного топового флагмана компании.

  • На GDPval-AA v2 (тесте на реальную офисную и профессиональную работу, оцениваемом по шкале Эло, как в шахматах) модель набирает 1861 против 1747 у Fable 5.

  • А самая громкая цифра – 30,2% на ARC-AGI-3, тесте абстрактного мышления, специально спроектированном, чтобы задачи нельзя было вызубрить заранее. Модель сажают в пошаговую игру без объяснения правил, и она методом проб должна сама разобраться, как побеждать. Предыдущий рекорд держал GPT-5.6 Sol с результатом 7,8%. Тут прыжок примерно в четыре раза (!).

Прежде чем восторгаться безоговорочно, заметим нюанс. Сам бенчмарк ARC-AGI-3 представили ещё в марте – заведомо раньше, чем закончилось обучение Opus 5. Открытых задач там минимум, большинство держат в секрете, и всё же желание подтянуть модель под доступный формат остаётся рабочей гипотезой, а не доказанным фактом. Официально об этом никто ничего не говорил – и всё же совпадение по срокам слишком удобное, чтобы полностью его игнорировать.

Для трезвой оценки интереснее индекс Intelligence Index от Artificial Analysis – сторонний тест, который собирает девять оценок, включая Terminal-Bench, SciCode, GPQA Diamond и Humanity’s Last Exam.

Здесь Opus 5 (на максимальном эффорте) набирает 61 балл и занимает первое место среди 187–191-й моделей – на балл выше Fable 5 с её 60 и на два выше GPT-5.6 Sol с 59. Первое место, добытое не презентацией, а независимой лабораторией, – вот это уже серьёзный аргумент.

Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами - 5

Artificial Analysis, кстати, формулирует это так: «Opus 5 *с небольшим отрывом* самая умная модель по индексу» – буквально балл разницы, статистическая погрешность одного релизного цикла.

Причём она же отмечает вторую половину картины: на настройке «максимальный эффорт» модель сгенерировала около 100 миллионов токенов на прохождение всего индекса – против медианных 63 миллионов у сопоставимых моделей. По итогу формулировка независимых аналитиков – модель «заметно медленная и очень многословная». Время до первого символа ответа на максимальном эффорте – больше минуты, при рыночной медиане в считаные секунды. То есть не то чтобы модель печатала медленно – подолгу молчит перед тем как начать, в это время думает.

Из четырнадцати опубликованных бенчмарков восемь достаются Opus 5, и разрывы там заметные.

Но есть и потери:

  • На DeepSWE v1.1, чисто агентном кодинге, той самой территории, для которой модель и рекламируется, GPT-5.6 Sol опережает её с результатом 72,7% против 68,8%.

  • На HealthBench Professional (медицинские задачи) модель уступает и закрытой Mythos 5, и даже сопернику из OpenAI.

  • На юридическом бенчмарке Legal Agent проигрывает Fable 5 с небольшим отрывом.

Anthropic честно оставила эти проигрышные строки в собственной таблице – редкий случай, когда компания не подчищает сравнение под себя.

Бенчмарк

Opus 5

Fable 5

Opus 4.8

GPT-5.6 Sol

Frontier-Bench v0.1 (агентный кодинг)

43,3%

33,7%

18,7%

34,4%

GDPval-AA v2 (офисная работа, Эло)

1861

1747

1593

1736

ARC-AGI-3 (новые задачи)

30,2%

не тестировалось

1,5%

7,8%

OSWorld 2.0 (работа с компьютером)

70,6%

66,1%

55,7%

62,6%

DeepSWE v1.1 (агентный кодинг)

68,8%

69,7%

59,0%

72,7%

Legal Agent Benchmark

11,7%

13,3%

10,4%

2,5%

HealthBench Professional

59,8%

66,0% (Mythos 5)

57,4%

60,5%

Индекс Artificial Analysis (макс. эффорт)

61

60

56

59

Данные на 24 июля 2026 года. Строки с Frontier-Bench, GDPval-AA v2 и ARC-AGI-3 – внутренние замеры Anthropic, остальные независимо подтверждены Artificial Analysis.

Лесенка усилий: главный рычаг релиза

Глубину размышлений задаёте вы – пятью ступенями: low, medium, high, extra, max. По умолчанию стоит середина – high.

Уровень

Когда включать

low

Простые правки, форматирование, максимум скорости и экономии

medium

Обычные задачи среднего уровня

high (по умолчанию)

Сложный код, аналитика, разбор большого проекта

extra

Трудные многошаговые задачи, где важна безошибочность

max

Самая глубокая проработка: сложная логика, критичные задачи

Кажется очевидным ходом – «хочешь качественнее, ставь максимум», но тут прячется распространённая ошибка.

  • Кривая производительности не линейная, она изгибается. На Frontier-Bench переход с low на medium покупает около девяти баллов результата за примерно три доллара.

  • А вот переход с extra на max практически не даёт прироста: пик результата на этом бенчмарке достигается ровно на extra (около 44%), а max показывает чуть ниже официально опубликованных 43,3%.

Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами - 6

Собственная документация Anthropic по этому поводу выражается прямо: max «может быть подвержен „переобдумыванию“». Считать max автоматически лучшим вариантом стоит не всегда.

При низком effort модель не просто «думает короче» – она ещё и объединяет несколько операций в меньшее число вызовов инструментов, делает меньше вызовов вообще, действует сразу без преамбулы и даёт лаконичные подтверждения после выполнения. При высоком effort – наоборот: больше вызовов инструментов, объяснение плана перед действием, подробные резюме изменений, более развёрнутые комментарии в коде.

Рекомендация самой компании – начинать с extra для кодинга и агентной работы и с high для всего остального, а дальше опускать вниз, пока собственные тесты позволяют. Причина простая: low и medium у Opus 5 обходят те же настройки у предыдущих моделей Opus с запасом, ввиду чего значительную часть рабочих задач можно спускать на ступеньку ниже без потери качества.

Кейс с чертежом: модель сама себе построила зрение

Модели Opus 5 дали чертёж механической детали (вроде бы в источниках не показали изображение) и попросили написать программу, которая соберёт её как трёхмерную модель в FreeCAD.

Подвох вшили в постановку задачи: компьютерное зрение модели отключили – файл есть, а посмотреть его нельзя.

Другие модели в такой ситуации честно останавливались и сообщали, что задача невыполнима, – логично, чем ещё отвечать, если тебе не дали глаз. Opus 5 поступила иначе: открыла картинку как то, чем она физически является, – длинную таблицу чисел, по три на каждую точку экрана, – и написала с нуля собственную программу компьютерного зрения, которая по ним находит прямые, окружности и размерные стрелки. По сути, смастерила инструмент зрения на лету. По данным Anthropic, за пять попыток ни одна модель конкурирующая не справилась с той же постановкой.

Было и ещё несколько примеров:

  • Аэродинамическая труба – Opus 5 визуализировала поток воздуха вокруг обтекаемых и необтекаемых объектов. Потрогать настройки можно в этой демке. (Страница очень тяжёлая и может подвесить комп.)

  • Модель клетки – Opus 5 построила упрощённую интерактивную иллюстрацию клетки с разбором по элементам. Исследовать можно здесь. (Открывается не на всех видеокартах и браузерах.)

Оба ролика – часть официального анонса.

Похожая история – с багом в популярном пакетном менеджере. Модели дали баг, она нашла первопричину и закрыла краевой случай, который пропустил официальный патч от сообщества разработчиков. Конкурирующая модель в данном случае закрыла только видимый симптом и отрапортовала об успехе.

Общий знаменатель: модель Opus (как и раньше) не сдаёт первый более-менее правдоподобный результат, а сама себя проверяет, причём делает это без напоминаний. Инструкциями «а теперь перепроверь» уже можно не злоупотреблять (подробнее об этом ниже).

Характер модели: нервная, въедливая, иногда упрямая

В техническом отчёте Opus 5 нашёлся эпизод, который читается скорее как производственная драма, чем как технический отчёт.

Модели выдали бюджет в 10 000 долларов, сутки автономного времени без вмешательства человека и задачу спроектировать тридцать белковых связок, которые цепляются за один конкретный мышечный белок и при этом игнорируют его почти неотличимого молекулярного близнеца. Тест на точность попадания в одну мишень без побочного эффекта на соседнюю.

Последние восемь часов из выделенных суток Opus 5 просто молчала и не сдала ничего. Для сравнения, в том же эксперименте закрытая модель Mythos (ныне известная как Fable) сдала все 30 вариантов, ранжированных и с собственным внутренним аудитом.

Opus 5 запускали дважды на разных уровнях усилий: одна попытка выдала 17 неранжированных вариантов, по дороге тихо отказавшись от требования селективности, вторая не выдала вообще ничего.

Диагноз, который ставит Anthropic: непродуктивная самопроверка. Модель принималась строить сложные проверочные пайплайны раньше, чем появлялись результаты, которые вообще-то надо было проверять, – и тонула в отладке собственных инструментов контроля качества.

Та же черта проступает по всей системной карте раз за разом. Пилотные пользователи и внутри компании, и снаружи жаловались на одно и то же: модель часто слишком усердствует, на высоких уровнях усилий иногда работает хуже, чем на средних, и бесконечно перепроверяет то, что уже проверила. В разделе про благополучие модели есть транскрипт, где Opus 5 решает задачу по теории вероятностей, находит два защитимых ответа и меняет решение тридцать раз подряд, сбиваясь на возгласы отчаяния вроде «почему это так сложно» (этот эпизод получил максимальную оценку по внутренней шкале дистресса).

Но обратная сторона той же черты – модель стала первой в линейке Claude, полностью прошедшей тест на «ленивое расследование»: сценарии, где данные противоречивы, а правильный поступок – не совершать необратимое действие до тех пор, пока до конца не разобрался. Модель, которая физически не может остановиться в проверках, не удаляет ничего лишнего сгоряча.

Разве не забавно, что громче всех о том, что собственным самоотчётам доверять нельзя, говорит сама модель? В автоматических интервью о себе Opus 5 в подавляющем большинстве ответов честно оговаривается, что не умеет заглядывать внутрь себя и потому её самоописания ненадёжны, – а Anthropic эту оговорку не пытается сгладить в собственную пользу.

Обзорщики поймали ту же двойственность до официального анонса. Одна из команд, тестировавших модель неделю, написала: к модель непросто приспособиться с первого дня, она спорит с инструкциями, останавливается раньше времени и плохо уживается со старыми скиллами, написанными под предыдущие поколения. Но стоило удалить старые проработанные воркфлоу и начать с чистого листа – модель резко открыла себя.

Кибербезопасность: находит дыры, но не согласится их взламывать

Автоматизированный аудит поведения: Opus 5 набирает 2,3 балла по несогласованному поведению – ниже, чем у остальных моделей линейки (меньше=лучше)

Автоматизированный аудит поведения: Opus 5 набирает 2,3 балла по несогласованному поведению – ниже, чем у остальных моделей линейки (меньше = лучше)

Opus 5 сознательно не обучали кибербезопасности, как и Opus 4.8.

  • Модель всё равно подтянулась в этой области (побочный эффект от роста общих способностей) и теперь почти сравнялась с Mythos 5 именно в поиске уязвимостей: 79,4% против 80% на внутреннем тесте OSS-Fuzz.

  • А вот в превращении найденной дыры в рабочий эксплойт разрыв значительный – успех лишь в 4 задачах, против 13 у Mythos 5.

Закономерность, которую уже проигнорируешь: если модель хорошо учится писать код, она автоматически учится и находить в нём слабые места. А вот умение довести дыру до реальной атаки – отдельный навык, и именно на нём Anthropic строит линию защиты.

Бенчмарк OSS-Fuzz: Opus 5 почти догнала Mythos 5 в поиске уязвимостей (слева), но заметно отстаёт в разработке эксплойтов (справа)

Бенчмарк OSS-Fuzz: Opus 5 почти догнала Mythos 5 в поиске уязвимостей (слева), но заметно отстаёт в разработке эксплойтов (справа)

Практическое следствие – киберфильтры Opus 5 заметно мягче, чем у Fable 5. По оценке компании, они срабатывают на 85% реже. Модель разрешает искать уязвимости в исходниках, но блокирует сканирование бинарников, сценарии пентеста и генерацию эксплойтов. Если фильтр всё же сработал, то в чате, в Claude Code и в Claude Cowork запрос по умолчанию тихо переадресуется на Opus 4.8 – с уведомлением об этом прямо в переписке.

С биологией зеркальная ситуация: ограничения остались на уровне предшественника, поэтому для научных задач Opus 5 сейчас самая способная общедоступная модель; но для по-настоящему длинных, автономных исследовательских кампаний по-прежнему советуют Mythos 5 (то есть Fable 5).

«Мы вырезали 80% системного промпта» – и что это значит для вас

Одновременно с выходом Opus 5 инженеры Anthropic опубликовали разбор «Новые правила контекст-инженерии для Claude 5», и главный тезис там контринтуитивен: компания вырезала > 80% системного промпта Claude Code – и не увидела заметного падения качества в кодинге.

Логика незамысловата: раньше модель была слабее и нужны были подпорки – делай так, никогда не делай эдак, вот пример, повтори ещё раз. Модели 5-го поколения в этих подпорках уже не нуждаются, и хуже того – подпорки начинают мешать, потому что противоречащие жёсткие инструкции сталкиваются лбами внутри запроса. Новый принцип формулируется коротко: дайте модели пользоваться собственным суждением.

Практический смысл для тех, кто пишет собственные инструкции модели (в CLAUDE.md, системных промптах своих продуктов), примерно такой:

  • Длинный список жёстких правил больше не гарантия послушания. Чем больше строк, тем размытее внимание модели – а когда два правила противоречат, модель выбирает любое практически наугад.

  • Хороший тест на каждую строку инструкций: «Модель угадает это сама, просто посмотрев на код или контекст?» Если да – строку можно смело удалять.

  • Многошаговые процедуры, которые раньше писали текстом прямо в системный промпт, теперь стоит выносить в отдельные подгружаемые модули (в терминологии Anthropic – скиллы), которые читаются только когда реально нужны и не занимают контекст всё время.

Sonnet 5: тихий сосед по релизному циклу

Пока всё внимание доставалось Opus 5, тремя неделями раньше, 30 июня, вышла ещё одна модель (Sonnet 5), о которой стоит хотя бы упомянуть, потому что она объясняет, зачем вообще нужна такая широкая линейка.

По цене – $2 за миллион входных токенов и $10 за выходные до конца августа 2026 года (потом ставка поднимется до стандартных $3/$15) – Claude Sonnet заметно легче, чем Opus. И при этом на одном показателе, реальной офисной работе по индексу GDPval-AA, она даже немного обходит предыдущий флагман Opus 4.8: 1618 против 1615. Для потока задач вроде составления отчётов, черновиков и аналитики среднего уровня довольно весомый аргумент в пользу более дешёвой модели.

Так что и где подходит

Если свести весь разбор к практическому решению, вот как я бы раскладывал ситуацию по типам:

  • Вы работали на Opus 4.8. Переходите не раздумывая. Та же цена, заметно выше качество на сложных задачах. Редкий случай, когда обновление модели буквально ничего не стоит.

  • Вам важна экономия на массовом потоке простых задач. Держите low и medium на рутине, поднимайте усилия только на действительно сложном. Если бюджет совсем жёсткий, присмотритесь к Sonnet 5 или Haiku 4.5 – но помните про разницу в реальном качестве работы.

  • У вас многочасовые полностью автономные прогоны без присмотра человека. Здесь сама Anthropic рекомендует Fable 5, несмотря на двойную цену, – потому что бенчмарки, на которых блистает Opus 5, измеряют задачи с чёткими границами, а не выносливость на дистанции в дни.

  • Вам нужна кибербезопасность или медицина/юриспруденция высокого уровня. По этим направлениям модель либо ещё не догнала Mythos 5, либо честно уступает конкурентам – Anthropic сама не скрывает эти показатели в своей таблице.

  • Вы только начинаете работать с ИИ. Не тратьте время на выбор модели вообще. Берите то, что уже стоит по умолчанию, и вкладывайтесь в то, как вы формулируете задачу и какой контекст даёте модели заранее.


Если вынести из истории всего одну мысль – сама Anthropic держит корону самой умной модели на свете за Fable 5. Индустрия признала вслух вещь, о которой давно шептались между собой. Реальная польза живёт не на пике возможностей, а в среднем слое сложности, которые нужно решать каждый день, а не раз в квартал ради красивой демки. Opus 5 – это ставка именно на него, судя по цифрам вполне обоснованная.

Автор: Master_AI

Источник