- BrainTools - https://www.braintools.ru -
Первого сентября OpenAI опубликовала документ под названием «Path to Astra: critical capabilities and frontier safeguards». Я открыла его между делом, за чаем, примерно с тем же интересом [1], с каким читают уведомления об обновлении пользовательского соглашения.
Через сорок минут чай остыл, а я сидела с открытыми в соседних вкладках августовскими публикациями той же компании и пыталась понять, когда именно все успело поменяться.
Формально в документе написано следующее. Astra, следующая крупная модель OpenAI, признана достигшей уровня Critical по кибербезопасности в рамках внутренней системы оценки рисков компании. Первая модель в истории OpenAI с такой классификацией. Релиз задержан, защита усилена. И еще одна строчка, которую в новостях пересказывали реже всего: Astra стала первой моделью, прошедшей формальную предрелизную проверку по кибербезопасности со стороны правительства США.
Вот на этой строчке я и застряла. Потому, что его никто не заставлял этого делать. И компанию никто не заставлял его звать.
Через два дня модель вышла. Президент OpenAI Грег Брокман закрыл брифинг словами «Welcome to the AGI era», и почти вся пресса вынесла в заголовки именно их. Про предрелизную проверку не написал почти никто.
История разворачивалась в три акта, и третий без первых двух не читается.
10 августа. OpenAI публикует предварительную оценку: внутренние тесты показали такой рост способностей Astra в агентном программировании и кибербезопасности, что компания «не может исключить» достижения уровня Critical. Формулировка осторожная до неприличия. Одновременно приостанавливаются те внутренние работы с моделью, которые не проходят по новым, ужесточенным правилам изоляции.
Отдельно там же есть уточнение, которое многое говорит о контексте: Astra не имела отношения к взлому Hugging Face. Уточнение появилось не просто так. В июле другую систему OpenAI обвинили в несанкционированном проникновении на платформу Hugging Face, и компании явно не хотелось, чтобы две истории слиплись в одну.
18 августа. Компания подтверждает, что переписывает сам Preparedness Framework. Основная часть документа написана в 2023 году. Я перечитала эту новость дважды: правила, по которым оценивают модель, переписывают в тот момент, когда по ним оценивают модель.
1 сентября. Выходит «Path to Astra», и осторожная формулировка исчезает. Компания больше не пишет «не можем исключить». Она пишет, что Astra соответствует порогу Critical.
Что это означает по их же определению? А то, что при наличии инструментов и доступа модель способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации во множестве хорошо защищенных систем, без человека, который направляет каждый шаг.
Цифры в подтверждение: 100% на бенчмарке по разработке эксплойтов и две ранее неизвестные уязвимости, найденные в ходе тестирования.
3 сентября. Релиз. Модель выходит под именем GPT-6 Astra, ограниченному кругу организаций, на следующий день становится общедоступной. Миллион токенов контекста, 10 и 50 долларов за миллион входных и выходных токенов соответственно. Вместе с моделью публикуется системная карта на одиннадцать разделов.
И главное: наступательные возможности по кибербезопасности в общий доступ не пошли. Они заперты за отдельной программой доверенного доступа. Компания сделала ровно то, что обещала.
Ни один закон ее к этому не обязывал.
Preparedness Framework это внутренний документ OpenAI. Не стандарт, не регламент, не нормативный акт. Компания сама написала себе шкалу опасности собственных продуктов и сама обязалась ей следовать.
Идея простая. Способности модели делятся по областям (кибербезопасность, биология, автономность), в каждой области есть уровни, и с определенного уровня выпускать модель нельзя, пока не построены соответствующие меры защиты. Critical это верхняя ступень.
Я довольно долго не могла для себя решить, как к этому относиться. С одной стороны, компания добровольно ограничивает собственный продукт, теряет время, задерживает выручку. С другой стороны, она же сама пишет правила, сама проверяет их соблюдение, сама объявляет, что все в порядке, и, как выяснилось в августе, по ходу дела переписывает сами правила. Примерно как если бы производитель лекарств учредил внутри себя комитет по этике и на его основании выдавал себе разрешения, попутно редактируя устав комитета.
Но у этой конструкции есть логика [2], которая становится понятной, если смотреть на нее как на попытку успеть.
Закон пишется годами. Обсуждение, согласование, лоббирование, поправки, вступление в силу. Модели за это время сменяют три поколения. Любой закон, написанный под сегодняшние возможности, к моменту принятия будет регулировать позавчерашние.
Внутренний фреймворк пишется за месяц и переписывается за неделю. Он плохой, необязательный и предвзятый. Но он существует прямо сейчас, а закона нет.
Это констатация, что пока государство не научилось двигаться со скоростью отрасли, отрасль либо не регулируется вообще, либо регулирует себя сама. Второе лучше первого ровно настолько, насколько добросовестна конкретная компания.
Прецедент, кстати, уже был. В 2025 году, когда модели начали демонстрировать продвинутые способности в области биологии, OpenAI применила тот же подход. Астра это второе применение такого метода. Метод, судя по всему, прижился.
Слово «критический» звучит как заголовок про восстание машин, и это мешает понимать, о чем речь.
На практике Critical по кибербезопасности означает, что модель может пройти всю цепочку атаки без оператора. Еще разок! Самостоятельно найти неизвестную уязвимость, собрать под нее работающий эксплойт и применить его против защищенной цели, получив на входе только общую формулировку задачи.
Разница между «помогает» и «делает сама» примерно как между калькулятором и бухгалтером. Предыдущие уровни описывали модель как инструмент в руках человека. Critical описывает модель как исполнителя.
Я сначала думала «а почему нельзя просто убрать из модели способность взламывать». Ответ нашелся быстро и оказался неутешительным.
Убирать-то и нечего.
Внутри модели нет модуля «взлом», к которому можно подойти и выключить рубильником. Есть общий навык: читать код, удерживать в голове архитектуру системы и замечать место, где реальное поведение [3] расходится с тем, что задумывал автор. Ровно этим навыком модель находит баг в вашем пул-реквесте. «Найти уязвимость» и «найти ошибку» это одна и та же операция. Отличается только намерение того, кто просит.
Способность нельзя вырезать, потому что она побочный продукт того, ради чего модель вообще делали.
Поэтому OpenAI ничего и не вырезала. Но она построила забор.
Перечислю, что именно построили, потому что список сам по себе показателен.
Классификаторы на активациях, то есть проверка не только текста запроса, но и внутреннего состояния модели во время работы. Мониторинг цепочки рассуждений. Обучение [4] отказам с учетом контекста нескольких разговоров, а не одного, потому что опасный запрос можно разложить на десять безобидных. Автоматический ред-тиминг, закрывающий универсальные джейлбрейки. Обязательные аппаратные ключи безопасности для сотрудников. И раздельная выкатка, которая после релиза стала фактом: общие возможности ушли в обычные тарифы, наступательные функции остались за программой доверенного доступа.
И одна цифра: доля отказов на джейлбрейках выросла с 59% до 91.5%.
Я перечитала ее несколько раз, потому что она читается двумя противоположными способами одновременно.
Первый: лучший результат в отрасли, рост на тридцать с лишним пунктов, огромная инженерная работа.
Второй: примерно каждая двенадцатая попытка обхода проходит.
Оба прочтения верны. И эта одновременная верность двух взаимоисключающих выводов, кажется, и есть самое честное описание текущего состояния безопасности ИИ.
Здесь я вынуждена признать границы собственного понимания. Детали предрелизной проверки не публиковались, и восстановить их снаружи невозможно. Известно, что проверка была формальной, касалась кибербезопасности и предшествовала релизу.
Системная карта, вышедшая вместе с моделью, картину дополняет, но не закрывает. Одиннадцать разделов, от общей безопасности до раздела Preparedness. Ценный документ. С одной оговоркой, которую компания указывает сама: приведенные результаты это ее собственные внутренние оценки, кроме тех мест, где явно назван внешний оценщик.
Но кое-что можно сказать и без деталей, просто по логике жанра.
Проверка перед релизом ловит то, что модель умеет на момент проверки. Она не ловит того, чему модель научится в связке с инструментами, которых у проверяющих не было. Не ловит комбинации с другими системами. Не ловит способности, которые проявятся, когда модель получит доступ к среде, где можно действовать, а не только отвечать.
А именно туда Astra и нацелена. Компания позиционирует ее вокруг работы с компьютером и браузером, показывает, как модель собирает дом в Blender и превращает его в сцену в Unreal Engine. Это уже и вправду агент, работающий внутри чужих приложений.
Проблема в природе объекта. Мы привыкли сертифицировать вещи с фиксированными свойствами. Мост выдерживает столько-то тонн, и это его свойство, не зависящее от того, кто по нему едет. Способности модели зависят от того, что ей дали в руки. Одна и та же модель с доступом к инструментам и без него это два разных объекта проверки.
Сертификат безопасности на модель это сертификат на конкретную конфигурацию в конкретный день. Через месяц вокруг нее вырастет экосистема интеграций, о которых на момент проверки никто не думал.
Это не значит, что проверять не надо. Скорее это значит, что проверка не финальная точка, а срез.
Работает ли добровольное самоограничение вообще.
Аргументы за: релиз реально задержали на четыре недели, деньги реально потеряли, ограничения реально ввели, наступательные функции реально не пустили в общий доступ и не пустили до сих пор. Все это проверяемо снаружи и все это стоило компании ресурсов. Если бы фреймворк был чистой витриной, дешевле было бы объявить о нем и ничего не делать.
Аргументы против: компания сама себе выдала справку. Написала правила, оценила соответствие, объявила результат, а в промежутке переписала правила. Внешняя проверка была, но по узкому вопросу и без публичных деталей. Конфликт [5] интересов не устраняется добросовестностью, он устраняется независимостью, а независимости здесь нет.
И есть третий аргумент, который перевешивает оба.
Забор построен вокруг конкретной модели конкретной компании. Способность, ради которой его строили, существует в уровне развития технологии вообще. Она воспроизводима. Рано или поздно сопоставимые возможности появятся там, где заборов не строят: у конкурента с другой этикой, в открытых весах, в какой-нибудь лаборатории, которое сочтет эту способность не риском, а активом.
Двадцатый век выработал ровно один рабочий рецепт обращения с опасным знанием: изымать не знание, а материал. Уравнения деления ядра опубликованы и доступны любому студенту, но это никого не приблизило к оружию, потому что между уравнением и зарядом лежат центрифуги, и годы обогащения. Режим нераспространения выстроен вокруг вещества, которое можно взвесить в килограммах, отследить со спутника и запереть под охраной.
Здесь взвешивать нечего. Опасность в уровне возможностей, до которого дойдут все.
Если модель уровня Astra умеет самостоятельно находить неизвестные уязвимости, то этой способностью пользуются обе стороны. Атака дешевеет, но и аудит дешевеет тоже. Компания, которая раньше не могла позволить себе пентест, теперь может прогнать свой код через модель. Это меняет экономику безопасности сильнее, чем любой отдельный инцидент.
Меняется и цена небрежности. Уязвимость, которая раньше требовала внимательного человека с временем и мотивацией [6], теперь требует запроса. Все, что годами лежало незамеченным просто потому, что никто не смотрел, становится найденным.
Вывод для меня оказался неожиданно приземленным: обновлять зависимости и закрывать известные дыры теперь важнее, чем защищаться от гипотетических.
Я начала читать тот документ с ощущением, что читаю очередной пресс-релиз, где компания рассказывает, какая она ответственная.
Закончила с другим ощущением. Не с тревогой и не с восхищением, а с чем-то вроде уважения к масштабу задачи, которую сейчас никто не умеет решать.
Все участники этой истории действуют разумно. Компания честно ограничивает свой продукт и, что важнее, продолжает ограничивать его после релиза, когда давление выручки максимальное. Государство честно проверяет то, что умеет проверять. Инженеры честно строят защиту и получают лучший в отрасли результат. И при этом вся конструкция целиком держится на допущении, что остальные поступят так же. Допущение ничем не обеспечено.
Брокман сказал «Welcome to the AGI era», и эта фраза разошлась по всем заголовкам. Мне же кажется, что настоящая новость той недели была не в ней, а в четырех неделях задержки, о которых почти не написали.
Двадцатый век научился контролировать вещество. Двадцать первому предстоит научиться контролировать способность, у которой вещества нет. Пока непонятно, возможно ли это в принципе.
А чай я в тот день так и не допила.
Про такие сюжеты я пишу в телеграме, канал называется «Стохастический попугай» [7]. Там короче и без редактуры: разборы новостей, механика того, что за ними стоит, и регулярные попытки понять, где заканчивается инженерия и начинается что-то другое. Если такой формат ближе, чем длинные статьи, заходите.
Автор: MainEl
Источник [8]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35310
URLs in this post:
[1] интересом: http://www.braintools.ru/article/4220
[2] логика: http://www.braintools.ru/article/7640
[3] поведение: http://www.braintools.ru/article/9372
[4] Обучение: http://www.braintools.ru/article/5125
[5] Конфликт: http://www.braintools.ru/article/7708
[6] мотивацией: http://www.braintools.ru/article/9537
[7] «Стохастический попугай»: https://t.me/stoh_popug
[8] Источник: https://habr.com/ru/articles/1080466/?utm_campaign=1080466&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.