- BrainTools - https://www.braintools.ru -

Исследовательская группа Epoch AI обновила лидерборд бенчмарка MirrorCode [1], добавив результаты новых флагманов Anthropic и OpenAI. Claude Fable 5 решил 64% задач, GPT-5.6 Sol — 20%. Разрыв втрое выглядит аномалией: на многих других тестах эти модели идут почти вровень, а кое-где Sol и вовсе впереди. Официального объяснения нет ни у Epoch, ни у Anthropic, но его можно восстановить по данным самого лидерборда.
MirrorCode — это бенчмарк, который Epoch AI разработала вместе с лабораторией METR. Идея такая: модель должна переписать целую программу с нуля, не видя ее исходного кода. Ей дают “черный ящик” — исполняемый файл, который можно только запускать, — документацию и видимую часть тестов. Программы настоящие и нетривиальные: потоковый редактор sed, линтер Ruff, утилиты биоинформатики, интерпретаторы языков, криптографические библиотеки, сжатие данных. Масштаб тоже настоящий: один из самых больших прогонов длился 19 дней автономной работы модели и стоил 2600 долларов.
Правила зачета жесткие. Решением считается только реализация, которая проходит 100% тестов — включая скрытые, которых модель не видит во время работы. Так авторы отсекают жульничество: подогнать вывод программы под известные тесты или собрать таблицу готовых ответов не получится, а интернет в песочнице отключен. В конфигурации лидерборда 15 программ среднего и большого размера, каждую нужно реализовать на двух языках, на попытку дается бюджет в 10 млрд токенов и 7 дней. Каждая задача прогоняется трижды.
Откуда же разрыв втрое? Подсказка — в тепловой карте результатов по отдельным задачам, которую Epoch публикует вместе с лидербордом. Она интереснее итоговой цифры.

Оказывается, GPT-5.6 Sol многие задачи бенчмарка решать умеет — но лишь иногда. В его строке преобладают 50%, 33% и 17% успешных попыток. У Claude Fable 5 те же задачи закрыты почти всегда: подряд идут 100 и 83. Разрыв возник не между “умеет” и “не умеет”, а между “иногда доводит до конца” и “доводит почти всегда”. Когда одна попытка — это дни работы, тысячи шагов и сотни или тысячи тестов, единственный проваленный крайний случай обнуляет результат целиком. На такой дистанции решает надежность, а не разовая вспышка гениальности [2].
Вторая улика — язык Ada. По правилам лидерборда половину реализаций модели обязаны писать на этом редком языке, который в 2026 году живет в основном в авионике и военных системах. Fable на нем почти не проседает: 64% на Go против 61% на Ada, разница всего три процентных пункта. У моделей OpenAI потери куда серьезнее: Sol лишается пятой части своего результата (с 24% до 19%), GPT-5.4 — почти половины (с 21% до 12%), а GPT-5.5 падает более чем втрое (с 17% до 5%).
Это важно вот почему. Главная претензия к MirrorCode — загрязнение обучающих данных, или контаминация. Программы в бенчмарке с открытым исходным кодом, и модели почти наверняка видели их во время обучения [3], что могло завысить результаты. Но реализаций этих программ на Ada в природе практически нет — вспоминать [4] нечего, код приходится писать заново. Значит, устойчивость Fable на Ada говорит скорее о навыке, чем о натренированной памяти [5].
Полностью снять скепсис это, впрочем, не может. Собственная проверка Epoch на запоминание [6] нашла его признаки у 17 из 25 целевых программ. Авторы подчеркивают, что результаты к памяти не сводятся — модели решали и незапомненные программы, а запомненные sed и Ruff проваливали, — но признают, что вклад запоминания исключить нельзя. Второе ограничение авторы называют сами: MirrorCode проверяет работу по идеально точной спецификации, где эталонная программа и тесты однозначно задают, что должно получиться. Так разработка в реальности почти никогда не выглядит, и результаты не доказывают, что ИИ потянет произвольный софтверный проект.
P.S. Поддержать меня можно подпиской на канал “сбежавшая нейросеть” [7], где я рассказываю про ИИ с творческой стороны.
Автор: runaway_llm
Источник [8]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/33914
URLs in this post:
[1] лидерборд бенчмарка MirrorCode: https://epoch.ai/MirrorCode
[2] гениальности: http://www.braintools.ru/article/4566
[3] обучения: http://www.braintools.ru/article/5125
[4] вспоминать: http://www.braintools.ru/article/3999
[5] памяти: http://www.braintools.ru/article/4140
[6] запоминание: http://www.braintools.ru/article/722
[7] “сбежавшая нейросеть”: https://t.me/ai_exee
[8] Источник: https://habr.com/ru/articles/1066254/?utm_campaign=1066254&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.