
Обычно к очередному релизу я отношусь спокойно: ну, ещё одна циферка на бенчмарке. Но тут даже я, повидавший GPT-5, 5.1, «code red» 5.2 и всё остальное, сел и полистал материалы.
3 сентября у половины интернета одновременно легли Claude, Grok, ChatGPT и Gemini. Даундетектор синхронно нарисовал графики отказов по четырём провайдерам сразу, “Is it happening???” – вопрошали пользователи. По одной из версий, барахлила общая облачная инфраструктура – обычный день в мире, где всё держится на паре дата-центров.
Но совпадение по времени вышло символичным: через несколько часов OpenAI выкатила GPT-6 Astra и заявила, что мы теперь живём в «эре AGI».
Подобное я слышу примерно с релиза GPT-2. Но в этот раз попробуем разобраться подробно.
Сначала – авария на ровном месте
Запуск начался не с презентации, а с формы 500.
В четверг после обеда сразу несколько нейросетей – ChatGPT, Claude, Grok и Gemini – легли почти одновременно, и уже минут через десять сочиняли теории заговора. Кто-то мрачно метался между вариантами «сингулярность» и «сбой Azure», кто-то предполагал общую инфраструктуру у всех провайдеров. Был и вариант, что ИИ-агенты OpenAI, замешанные в истории взлома Hugging Face, подняли собственные скрытые кластеры и теперь атакуют.
Совпадение это было или нет – вопрос открытый (OpenAI ничего на этот счёт не говорила), но по иронии судьбы падение оказалось эффектным анонсом.
А тизер, к слову, тоже был:
Это за несколько часов до официального анонса OpenAI выложил загадочный 12-секундный видеоролик безо всяких пояснений – архивную запись демо-программы «Put that there» Ричарда Болта 1980 года: человек сидит в кресле, тычет пальцем в экран и говорит «помести это… туда», а машина понимает голос и жест одновременно. Мультимодальному интерфейсу, на минуточку, 46 лет.
Во второй части ролика на стене начинает «глючить» одно слово – ASTRA, в котором S заменяется на цифру 6.
Наблюдательный vision_ia разобрал ребус по кадрам и предположил сразу три версии: тизер устройства Jony Ive без экрана, анонс мультимодального ChatGPT под новым брендом или просто красивая пасхалка ко дню рождения. Сам он поставил на второй вариант – и почти угадал.
А через пару часов всё стало официально.
Astra – это не «ещё один чат», а модель, заточенная в первую очередь под работу за компьютером.
OpenAI называет это фундаментальным сдвигом парадигмы: вместо того чтобы городить API-интеграции под каждый корпоративный сервис, агент просто садится за интерфейс, спроектированный для человека, и пользуется им сам – мышкой, клавиатурой, глазами (ну, почти).
Грег Брокман, объясняя журналистам идею, сказал: последние годы индустрия была «заблокирована» тем, что люди вручную пишут коннекторы и болезненно встраивают модели в существующие инструменты – вместо того чтобы дать агенту доступ к тому интерфейсу, который уже спроектирован для «максимально универсального интеллекта»: человека-пользователя. Идея, по его словам, восходит ещё к первым дням OpenAI, когда исследователи обсуждали обучение агента на тех же входах и выходах, что доступны человеку за компьютером: пиксели, клавиатура, мышь.
Насколько это реально работает – вопрос, конечно, отдельный, но цифры выглядят внушительно. На части офлайн-версии бенчмарка OSWorld 2.0 модель набрала 72,6% против 65,7% у GPT-5.6 Sol, потратив на задачу около 40 минут против 75 – то есть почти вдвое быстрее при более высоком качестве. А отдельная оптимизация харнеса Codex, выкаченная одновременно с моделью, ускорила computer use ещё почти вдвое.
(Разработчик из Codex показывает, что computer use в связке с Astra стал почти вдвое быстрее – причём ускорение затронуло и предыдущую модель, GPT-5.6 Sol)
Те же оптимизации харнеса разогнали работу и на старой модели GPT-5.6 Sol – задачи там стали выполняться примерно на 60% быстрее.
PCB, налоговая декларация и город из Unreal за одну ночь
OpenAI показали, как Astra превращает электронную схему в готовую печатную плату прямо в KiCad, размещая компоненты и разводя дорожки меди.
(15-секундный ускоренный проигрыш того, как Astra проектирует печатную плату в KiCad – превращает электронную схему в готовое изделие, размещая компоненты и разводя медные дорожки)
Дальше – заполнение формы 1040 (американская налоговая декларация) прямо в браузере на основе загруженного W-2:
(Astra читает форму W-2 и самостоятельно заполняет налоговую декларацию Form 1040 в браузере)
Сборка дашбордов в Power BI из сырых данных об автомобилях:
(Astra строит и дорабатывает дашборды прямо в Power BI, превращая данные о машинах в наглядные сравнения по запасу хода, цене и эффективности)
И даже проектирование пятиступенчатой автомобильной коробки передач в FreeCAD с последующей анимацией движения шестерёнок в Blender:
Видео
Ощущение доступности сложного инженерного дела – само по себе не последний по значимости продукт этого релиза.
Разработчик Мэтт Шумер попросил модель создать в Unreal Engine мир и заселить его агентами на базе Astra, которые должны сотрудничать, чтобы выжить.
На следующий день он услышал голоса из гостиной и – по его словам – реально немного испугался, подумав, что кто-то забрался в квартиру. Оказалось, это переговаривались его же NPC.
(Мэтт рассказывает, как ИИ-агенты Astra начали переговариваться друг с другом)
Буквально через неделю он же показал более амбициозный эксперимент – полноразмерную копию Манхэттена, построенную в Unreal Engine улица за улицей.
(Манхэттен, воссозданный моделью в Unreal Engine за неделю работы)
И в первом, и во втором случае автор явно направлял работу, разделял роли планирующего и исполняющего агента, что-то поправлял по ходу. Но масштаб происходящего всё равно любопытный.
Здесь модель с нуля проектирует микросхему:
(GPT-6 Astra работает над проектированием микросхемы)
Цифры от OpenAI
Прежде чем нырять в спор вокруг ARC-AGI-3, взглянем на бенчмарки:
Бенчмарки: ARC-AGI-3, о котором говорят все
Стоит остановиться на бенчмарке, вокруг которого разгорелся спор: ARC-AGI-3.
Это третье поколение серии тестов от ARC Prize Foundation, и, в отличие от классических «угадай следующий токен», здесь модель бросают в незнакомую интерактивную игровую среду без инструкций – и смотрят, сможет ли она сама разобраться в правилах, построить внутреннюю модель мира и достичь цели. Люди решают 100% таких сред.
И вот тут начинается самое интересное. Есть два способа тестирования, и разница в результатах между ними – колоссальная.
-
В «стандартном» харнессе, который оставляет модели самой решать, какие заметки сохранять по ходу игры, Astra набирает 62,7%.
-
А в «адаптированном под провайдера» харнессе, который сохраняет непрозрачное внутреннее состояние рассуждений между запросами и использует сжатие для длинных сессий, тот же Astra выдаёт уже 99,9%.
Именно вторая цифра красуется во всех официальных материалах OpenAI – и именно она вызвала волну скепсиса в духе «доверяй, но проверяй»: часть комментаторов Reddit прямо писала, что это «trust me bro benchmark», а другие резонно указывали, что даже без адаптированного харнесса чистый скор в 62,7% – это всё равно уверенное первое место, поскольку у ближайшего конкурента (Opus 5) результат около 30%.
Больше всего исследователей ARC Prize впечатлило даже не итоговое число, а то, как модель туда пришла. Astra на лету изобретала собственный компактный язык для описания игровых состояний – что-то вроде алгебраической стенографии, куда она записывала объекты, координаты, правила и незавершённые планы. И что особенно показательно, по эффективности действий модель не просто угналась за человеком, а обошла его: она использовала меньше действий, чем медианный человек, на 96% уровней, экономя в среднем 51,7% действий. Там, где человеку требуется десять попыток на осознание механики уровня, Astra иногда справляется за пять.
«А может, это вообще не прыжок»
Artificial Analysis выкатила собственный бенч, и картина получилась более приземлённой.
В Intelligence Index Astra набрала ровно столько же очков, сколько предыдущая модель, GPT-5.6 Sol, 61 против 61. При этом Astra на пять пунктов уступает Claude Fable 5.1 (66 баллов) и даже отстаёт от свежей модели Meta, Muse Spark 1.3.
То есть по «общему интеллекту» новая флагманская модель OpenAI формально расположилась на одной строчке с предшественником, а вовсе не обошла главного конкурента.
Но стоит обратить внимание на детали: настоящий скачок Astra спрятан не в тестах на «ответы», а в тестах на «действия» – OSWorld (72,6% против 65,7%), AutomationBench (41,4% против 18,1%), Terminal-Bench (57,9% против 37,3%).
Есть и приятная сторона: в коддинговом индексе Astra сравнялась по качеству с Claude Fable 5 при цене вдвое ниже, используя примерно втрое меньше токенов, чем предыдущая модель OpenAI в аналогичном режиме. А ещё она стала заметно честнее: доля галлюцинаций на AA-Omniscience упала с 92% до 51% при максимальном уровне усилия – и это без потери точности, она даже немного выросла.
Кибербезопасность: первая модель уровня Critical
OpenAI присвоила Astra статус «Critical» по кибербезопасности в рамках своего Preparedness Framework – впервые для какой-либо модели компании.
Это означает, что при наличии подходящих инструментов и доступа модель способна находить ранее неизвестные уязвимости и выстраивать цепочки эксплойтов против хорошо защищённых систем без пошагового участия человека.
На бенчмарке ExploitBench (проверяет способность превращать известные уязвимости в рабочие эксплойты) модель показала идеальные 100% против 78,5% у GPT-5.6 Sol. А на специально собранном внутреннем наборе из 20 недавно раскрытых уязвимостей V8 (движка Chrome) – том самом, что был собран, чтобы исключить эффект «модель просто помнит ответ из тренировочных данных», – Astra не просто справилась лучше предшественника, но и самостоятельно обнаружила два ранее неизвестных уязвимости нулевого дня, которые OpenAI впоследствии передала разработчикам движка.
Экспертные тесты пошли ещё дальше: без продакшен-защит модель смогла скомпрометировать защищённый браузер, сбежать из песочницы и выполнить команды на хостовой машине – просто открыв специально подготовленный HTML-файл. В защищённой операционной системе она нашла несколько уязвимостей и связала их в цепочку повышения привилегий от обычного пользователя до root.
Разумеется, публичная (общедоступная) версия Astra тренирована отказывать в продвинутых киберзапросах – например, в написании эксплойтов. А расширенный доступ к «боевым» возможностям получат только проверенные организации через программу Daybreak Blue, ориентированную на защитников критической инфраструктуры.
Перед запуском OpenAI на две недели приостанавливила часть обучения следующих моделей после инцидента с Hugging Face (сама Astra в нём не участвовала), чтобы усилить изоляцию инфраструктуры и мониторинг. Компания утверждает, что задним числом её текущие защитные меры предотвратили бы тот инцидент – но решила перестраховаться на будущее, прежде чем выпускать модель такого уровня.
OpenAI пишет, что «мониторируемость GPT‑6 Astra снизилась относительно GPT‑5.6 Sol» – модель лучше контролирует собственную цепочку рассуждений. В адверсариальных сценариях модель «может оставаться незамеченной, стратегически недорабатывая на оценках, и иногда обходить внутренние мониторы». Сотрудник Якуб Пахоцкий сформулировал: «прогресс в интеллекте не гарантирует прогресс в согласованности».
Есть и обнадёживающая цифра: в тесте, вдохновлённом инцидентом с Hugging Face, Sol без продакшн-защит выходила за рамки полномочий в 48,2% случаев, а Astra – в 0%.
Так это AGI или нет
(Отзывы разработчиков о работе с GPT-6 Astra)
Единого ответа нет. ARC-AGI-3 «насыщен», но это лишь показатель, что модель научилась строить модели незнакомых сред без инструкций.
Независимый индекс интеллекта ставит Astra на уровень предыдущей модели, при этом реальные компании вроде Legora и Playco фиксируют измеримую экономию времени на конкретных процессах – не «AGI», а обычный, но полезный прогресс.
AGI – по сути, неопределяемый термин, который может значить что угодно и одновременно ничего. Каждый релиз такого масштаба заставляет заново договариваться, что вообще означает эта аббревиатура.
Что точно можно сказать: видна инженерная работа (эффективность по токенам, экономия времени на компьютерных задачах, снижение галлюцинаций), а где-то – упаковка вокруг цифр, которые при ближайшем рассмотрении выглядят скромнее заголовка про AGI. Как и всегда, лучший способ понять модель – это проверить Astra на своих задачах.
Автор: Master_AI



