
Полтора месяца все обсуждали Fable 5. Её выпустили 9 июня, через три дня отключили по требованию Минторга США (экспортные ограничения, что-то про уязвимость в защите), а 30 июня вернули обратно, но уже без места в обычной подписке. Кто следил за новостями, помнит эти качели: анонс года, внезапная пауза, потом тихое возвращение. Ощущение осталось смешанное – модель топовая, а трогать её разрешалось немногим.
И вот 24 июля Anthropic выкатывает Claude Opus 5. Дешевле вдвое, доступна сразу всем. А по независимому рейтингу Artificial Analysis обошла саму Fable 5 – совсем немного, но обошла. Как будто кто-то в компании посмотрел на весь этот цирк с санкциями и решил: ладно, сделаем модель, о которой не придётся оправдываться регуляторам.

Гонка, в которой никто не успевает выдохнуть
Чтобы понять, почему Opus 5 вообще случилась именно сейчас, нужно вспомнить темп последних месяцев.
Anthropic выпустила четыре модели меньше чем за два месяца: Mythos 5 и Fable 5–9 июня, Sonnet 5 – 30 июня, и вот теперь Opus 5 – 24 июля. Для индустрии, где привычно одна модель жила флагманом год, это уже что-то похожее на конвейер.
Смысл в этой спешке, на самом деле, простой. Раньше лаборатории соревновались в том, что лучшая модель может сделать в свой лучший день – на самом сложном бенчмарке, в самой эффектной демке. Теперь конкуренция сместилась в такую сторону: что очень хорошая модель может делать каждый день, за вменяемую цену. Тот самый средний слой сложности, где живёт 90% реальной работы, а не разовые подвиги.
Именно поэтому Opus 5 – это не «Opus 4.9», а полноценное пятое поколение с новым номером. Anthropic сама формулирует без двусмысленностей: модель «приближается к передовому интеллекту Claude Fable 5 – за половину ее цены».
Что вообще такое Opus 5
Это старшая массовая модель линейки Claude, стоящая между Sonnet 5 и закрытой парой Fable 5/Mythos 5. На вход она принимает текст, изображения и файлы; на выход выдаёт текст (картинок, аудио, видео она не рисует) или выполняет агентные задачи.
Контекстное окно – 1 000 000 токенов, и это одновременно значение по умолчанию и потолок. Меньшего варианта попросту нет. Максимум генерируемого аутпута – 128 000 токенов. Режим рассуждений включен по умолчанию (и это уже давно в Claude) – модель проводит внутреннюю проработку задачи, прежде чем ответить. Глубина проработки регулируется параметром усилий (effort).
Бенчмарки: где отрыв настоящий

Часть цифр с презентации – это внутренние метрики Anthropic; Frontier-Bench, GDPval-AA – никто снаружи их не воспроизводил. Часть – независимые замеры других компаний, вроде индекса Artificial Analysis.
Разложим их по отдельности.

По собственным замерам Anthropic картина выглядит эффектно.
-
На Frontier-Bench v0.1 (тесте на агентное программирование в терминале) Opus 5 набирает 43,3%, притом что предыдущий Opus 4.8 показывал 18,7%, а Fable 5 – 33,7%. Это более чем вдвое сильнее предшественника и заметно выше собственного топового флагмана компании.
-
На GDPval-AA v2 (тесте на реальную офисную и профессиональную работу, оцениваемом по шкале Эло, как в шахматах) модель набирает 1861 против 1747 у Fable 5.
-
А самая громкая цифра – 30,2% на ARC-AGI-3, тесте абстрактного мышления, специально спроектированном, чтобы задачи нельзя было вызубрить заранее. Модель сажают в пошаговую игру без объяснения правил, и она методом проб должна сама разобраться, как побеждать. Предыдущий рекорд держал GPT-5.6 Sol с результатом 7,8%. Тут прыжок примерно в четыре раза (!).
Прежде чем восторгаться безоговорочно, заметим нюанс. Сам бенчмарк ARC-AGI-3 представили ещё в марте – заведомо раньше, чем закончилось обучение Opus 5. Открытых задач там минимум, большинство держат в секрете, и всё же желание подтянуть модель под доступный формат остаётся рабочей гипотезой, а не доказанным фактом. Официально об этом никто ничего не говорил – и всё же совпадение по срокам слишком удобное, чтобы полностью его игнорировать.
Для трезвой оценки интереснее индекс Intelligence Index от Artificial Analysis – сторонний тест, который собирает девять оценок, включая Terminal-Bench, SciCode, GPQA Diamond и Humanity’s Last Exam.
Здесь Opus 5 (на максимальном эффорте) набирает 61 балл и занимает первое место среди 187–191-й моделей – на балл выше Fable 5 с её 60 и на два выше GPT-5.6 Sol с 59. Первое место, добытое не презентацией, а независимой лабораторией, – вот это уже серьёзный аргумент.

Artificial Analysis, кстати, формулирует это так: «Opus 5 *с небольшим отрывом* самая умная модель по индексу» – буквально балл разницы, статистическая погрешность одного релизного цикла.
Причём она же отмечает вторую половину картины: на настройке «максимальный эффорт» модель сгенерировала около 100 миллионов токенов на прохождение всего индекса – против медианных 63 миллионов у сопоставимых моделей. По итогу формулировка независимых аналитиков – модель «заметно медленная и очень многословная». Время до первого символа ответа на максимальном эффорте – больше минуты, при рыночной медиане в считаные секунды. То есть не то чтобы модель печатала медленно – подолгу молчит перед тем как начать, в это время думает.
Из четырнадцати опубликованных бенчмарков восемь достаются Opus 5, и разрывы там заметные.
Но есть и потери:
-
На DeepSWE v1.1, чисто агентном кодинге, той самой территории, для которой модель и рекламируется, GPT-5.6 Sol опережает её с результатом 72,7% против 68,8%.
-
На HealthBench Professional (медицинские задачи) модель уступает и закрытой Mythos 5, и даже сопернику из OpenAI.
-
На юридическом бенчмарке Legal Agent проигрывает Fable 5 с небольшим отрывом.
Anthropic честно оставила эти проигрышные строки в собственной таблице – редкий случай, когда компания не подчищает сравнение под себя.
|
Бенчмарк |
Opus 5 |
Fable 5 |
Opus 4.8 |
GPT-5.6 Sol |
|
Frontier-Bench v0.1 (агентный кодинг) |
43,3% |
33,7% |
18,7% |
34,4% |
|
GDPval-AA v2 (офисная работа, Эло) |
1861 |
1747 |
1593 |
1736 |
|
ARC-AGI-3 (новые задачи) |
30,2% |
не тестировалось |
1,5% |
7,8% |
|
OSWorld 2.0 (работа с компьютером) |
70,6% |
66,1% |
55,7% |
62,6% |
|
DeepSWE v1.1 (агентный кодинг) |
68,8% |
69,7% |
59,0% |
72,7% |
|
Legal Agent Benchmark |
11,7% |
13,3% |
10,4% |
2,5% |
|
HealthBench Professional |
59,8% |
66,0% (Mythos 5) |
57,4% |
60,5% |
|
Индекс Artificial Analysis (макс. эффорт) |
61 |
60 |
56 |
59 |
Данные на 24 июля 2026 года. Строки с Frontier-Bench, GDPval-AA v2 и ARC-AGI-3 – внутренние замеры Anthropic, остальные независимо подтверждены Artificial Analysis.
Лесенка усилий: главный рычаг релиза
Глубину размышлений задаёте вы – пятью ступенями: low, medium, high, extra, max. По умолчанию стоит середина – high.
|
Уровень |
Когда включать |
|
|
Простые правки, форматирование, максимум скорости и экономии |
|
|
Обычные задачи среднего уровня |
|
|
Сложный код, аналитика, разбор большого проекта |
|
|
Трудные многошаговые задачи, где важна безошибочность |
|
|
Самая глубокая проработка: сложная логика, критичные задачи |
Кажется очевидным ходом – «хочешь качественнее, ставь максимум», но тут прячется распространённая ошибка.
-
Кривая производительности не линейная, она изгибается. На Frontier-Bench переход с
lowнаmediumпокупает около девяти баллов результата за примерно три доллара. -
А вот переход с
extraнаmaxпрактически не даёт прироста: пик результата на этом бенчмарке достигается ровно наextra(около 44%), аmaxпоказывает чуть ниже официально опубликованных 43,3%.

Собственная документация Anthropic по этому поводу выражается прямо: max «может быть подвержен „переобдумыванию“». Считать max автоматически лучшим вариантом стоит не всегда.
При низком effort модель не просто «думает короче» – она ещё и объединяет несколько операций в меньшее число вызовов инструментов, делает меньше вызовов вообще, действует сразу без преамбулы и даёт лаконичные подтверждения после выполнения. При высоком effort – наоборот: больше вызовов инструментов, объяснение плана перед действием, подробные резюме изменений, более развёрнутые комментарии в коде.
Рекомендация самой компании – начинать с extra для кодинга и агентной работы и с high для всего остального, а дальше опускать вниз, пока собственные тесты позволяют. Причина простая: low и medium у Opus 5 обходят те же настройки у предыдущих моделей Opus с запасом, ввиду чего значительную часть рабочих задач можно спускать на ступеньку ниже без потери качества.
Кейс с чертежом: модель сама себе построила зрение
Модели Opus 5 дали чертёж механической детали (вроде бы в источниках не показали изображение) и попросили написать программу, которая соберёт её как трёхмерную модель в FreeCAD.
Подвох вшили в постановку задачи: компьютерное зрение модели отключили – файл есть, а посмотреть его нельзя.
Другие модели в такой ситуации честно останавливались и сообщали, что задача невыполнима, – логично, чем ещё отвечать, если тебе не дали глаз. Opus 5 поступила иначе: открыла картинку как то, чем она физически является, – длинную таблицу чисел, по три на каждую точку экрана, – и написала с нуля собственную программу компьютерного зрения, которая по ним находит прямые, окружности и размерные стрелки. По сути, смастерила инструмент зрения на лету. По данным Anthropic, за пять попыток ни одна модель конкурирующая не справилась с той же постановкой.
Было и ещё несколько примеров:
-
Аэродинамическая труба – Opus 5 визуализировала поток воздуха вокруг обтекаемых и необтекаемых объектов. Потрогать настройки можно в этой демке. (Страница очень тяжёлая и может подвесить комп.)
-
Модель клетки – Opus 5 построила упрощённую интерактивную иллюстрацию клетки с разбором по элементам. Исследовать можно здесь. (Открывается не на всех видеокартах и браузерах.)
Оба ролика – часть официального анонса.
Похожая история – с багом в популярном пакетном менеджере. Модели дали баг, она нашла первопричину и закрыла краевой случай, который пропустил официальный патч от сообщества разработчиков. Конкурирующая модель в данном случае закрыла только видимый симптом и отрапортовала об успехе.
Общий знаменатель: модель Opus (как и раньше) не сдаёт первый более-менее правдоподобный результат, а сама себя проверяет, причём делает это без напоминаний. Инструкциями «а теперь перепроверь» уже можно не злоупотреблять (подробнее об этом ниже).
Характер модели: нервная, въедливая, иногда упрямая
В техническом отчёте Opus 5 нашёлся эпизод, который читается скорее как производственная драма, чем как технический отчёт.
Модели выдали бюджет в 10 000 долларов, сутки автономного времени без вмешательства человека и задачу спроектировать тридцать белковых связок, которые цепляются за один конкретный мышечный белок и при этом игнорируют его почти неотличимого молекулярного близнеца. Тест на точность попадания в одну мишень без побочного эффекта на соседнюю.
Последние восемь часов из выделенных суток Opus 5 просто молчала и не сдала ничего. Для сравнения, в том же эксперименте закрытая модель Mythos (ныне известная как Fable) сдала все 30 вариантов, ранжированных и с собственным внутренним аудитом.
Opus 5 запускали дважды на разных уровнях усилий: одна попытка выдала 17 неранжированных вариантов, по дороге тихо отказавшись от требования селективности, вторая не выдала вообще ничего.
Диагноз, который ставит Anthropic: непродуктивная самопроверка. Модель принималась строить сложные проверочные пайплайны раньше, чем появлялись результаты, которые вообще-то надо было проверять, – и тонула в отладке собственных инструментов контроля качества.
Та же черта проступает по всей системной карте раз за разом. Пилотные пользователи и внутри компании, и снаружи жаловались на одно и то же: модель часто слишком усердствует, на высоких уровнях усилий иногда работает хуже, чем на средних, и бесконечно перепроверяет то, что уже проверила. В разделе про благополучие модели есть транскрипт, где Opus 5 решает задачу по теории вероятностей, находит два защитимых ответа и меняет решение тридцать раз подряд, сбиваясь на возгласы отчаяния вроде «почему это так сложно» (этот эпизод получил максимальную оценку по внутренней шкале дистресса).
Но обратная сторона той же черты – модель стала первой в линейке Claude, полностью прошедшей тест на «ленивое расследование»: сценарии, где данные противоречивы, а правильный поступок – не совершать необратимое действие до тех пор, пока до конца не разобрался. Модель, которая физически не может остановиться в проверках, не удаляет ничего лишнего сгоряча.
Разве не забавно, что громче всех о том, что собственным самоотчётам доверять нельзя, говорит сама модель? В автоматических интервью о себе Opus 5 в подавляющем большинстве ответов честно оговаривается, что не умеет заглядывать внутрь себя и потому её самоописания ненадёжны, – а Anthropic эту оговорку не пытается сгладить в собственную пользу.
Обзорщики поймали ту же двойственность до официального анонса. Одна из команд, тестировавших модель неделю, написала: к модель непросто приспособиться с первого дня, она спорит с инструкциями, останавливается раньше времени и плохо уживается со старыми скиллами, написанными под предыдущие поколения. Но стоило удалить старые проработанные воркфлоу и начать с чистого листа – модель резко открыла себя.
Кибербезопасность: находит дыры, но не согласится их взламывать
Opus 5 сознательно не обучали кибербезопасности, как и Opus 4.8.
-
Модель всё равно подтянулась в этой области (побочный эффект от роста общих способностей) и теперь почти сравнялась с Mythos 5 именно в поиске уязвимостей: 79,4% против 80% на внутреннем тесте OSS-Fuzz.
-
А вот в превращении найденной дыры в рабочий эксплойт разрыв значительный – успех лишь в 4 задачах, против 13 у Mythos 5.
Закономерность, которую уже проигнорируешь: если модель хорошо учится писать код, она автоматически учится и находить в нём слабые места. А вот умение довести дыру до реальной атаки – отдельный навык, и именно на нём Anthropic строит линию защиты.
Практическое следствие – киберфильтры Opus 5 заметно мягче, чем у Fable 5. По оценке компании, они срабатывают на 85% реже. Модель разрешает искать уязвимости в исходниках, но блокирует сканирование бинарников, сценарии пентеста и генерацию эксплойтов. Если фильтр всё же сработал, то в чате, в Claude Code и в Claude Cowork запрос по умолчанию тихо переадресуется на Opus 4.8 – с уведомлением об этом прямо в переписке.
С биологией зеркальная ситуация: ограничения остались на уровне предшественника, поэтому для научных задач Opus 5 сейчас самая способная общедоступная модель; но для по-настоящему длинных, автономных исследовательских кампаний по-прежнему советуют Mythos 5 (то есть Fable 5).
«Мы вырезали 80% системного промпта» – и что это значит для вас
Одновременно с выходом Opus 5 инженеры Anthropic опубликовали разбор «Новые правила контекст-инженерии для Claude 5», и главный тезис там контринтуитивен: компания вырезала > 80% системного промпта Claude Code – и не увидела заметного падения качества в кодинге.
Логика незамысловата: раньше модель была слабее и нужны были подпорки – делай так, никогда не делай эдак, вот пример, повтори ещё раз. Модели 5-го поколения в этих подпорках уже не нуждаются, и хуже того – подпорки начинают мешать, потому что противоречащие жёсткие инструкции сталкиваются лбами внутри запроса. Новый принцип формулируется коротко: дайте модели пользоваться собственным суждением.
Практический смысл для тех, кто пишет собственные инструкции модели (в CLAUDE.md, системных промптах своих продуктов), примерно такой:
-
Длинный список жёстких правил больше не гарантия послушания. Чем больше строк, тем размытее внимание модели – а когда два правила противоречат, модель выбирает любое практически наугад.
-
Хороший тест на каждую строку инструкций: «Модель угадает это сама, просто посмотрев на код или контекст?» Если да – строку можно смело удалять.
-
Многошаговые процедуры, которые раньше писали текстом прямо в системный промпт, теперь стоит выносить в отдельные подгружаемые модули (в терминологии Anthropic – скиллы), которые читаются только когда реально нужны и не занимают контекст всё время.
Sonnet 5: тихий сосед по релизному циклу
Пока всё внимание доставалось Opus 5, тремя неделями раньше, 30 июня, вышла ещё одна модель (Sonnet 5), о которой стоит хотя бы упомянуть, потому что она объясняет, зачем вообще нужна такая широкая линейка.
По цене – $2 за миллион входных токенов и $10 за выходные до конца августа 2026 года (потом ставка поднимется до стандартных $3/$15) – Claude Sonnet заметно легче, чем Opus. И при этом на одном показателе, реальной офисной работе по индексу GDPval-AA, она даже немного обходит предыдущий флагман Opus 4.8: 1618 против 1615. Для потока задач вроде составления отчётов, черновиков и аналитики среднего уровня довольно весомый аргумент в пользу более дешёвой модели.
Так что и где подходит
Если свести весь разбор к практическому решению, вот как я бы раскладывал ситуацию по типам:
-
Вы работали на Opus 4.8. Переходите не раздумывая. Та же цена, заметно выше качество на сложных задачах. Редкий случай, когда обновление модели буквально ничего не стоит.
-
Вам важна экономия на массовом потоке простых задач. Держите
lowиmediumна рутине, поднимайте усилия только на действительно сложном. Если бюджет совсем жёсткий, присмотритесь к Sonnet 5 или Haiku 4.5 – но помните про разницу в реальном качестве работы. -
У вас многочасовые полностью автономные прогоны без присмотра человека. Здесь сама Anthropic рекомендует Fable 5, несмотря на двойную цену, – потому что бенчмарки, на которых блистает Opus 5, измеряют задачи с чёткими границами, а не выносливость на дистанции в дни.
-
Вам нужна кибербезопасность или медицина/юриспруденция высокого уровня. По этим направлениям модель либо ещё не догнала Mythos 5, либо честно уступает конкурентам – Anthropic сама не скрывает эти показатели в своей таблице.
-
Вы только начинаете работать с ИИ. Не тратьте время на выбор модели вообще. Берите то, что уже стоит по умолчанию, и вкладывайтесь в то, как вы формулируете задачу и какой контекст даёте модели заранее.
Если вынести из истории всего одну мысль – сама Anthropic держит корону самой умной модели на свете за Fable 5. Индустрия признала вслух вещь, о которой давно шептались между собой. Реальная польза живёт не на пике возможностей, а в среднем слое сложности, которые нужно решать каждый день, а не раз в квартал ради красивой демки. Opus 5 – это ставка именно на него, судя по цифрам вполне обоснованная.
Автор: Master_AI


