- BrainTools - https://www.braintools.ru -

Президент и сооснователь OpenAI Грег Брокман попросил ChatGPT проверить безопасность собственного сайта — и получил список из 13 проблем за четверть часа. Сайт при этом самый скучный из возможных: статичная страница на AWS, спрятанная за Cloudflare, ломать там на первый взгляд нечего. Модель (публичная GPT-5.6 Sol, никаких внутренних сборок) нашла, что для домена не настроена защита от подделки писем — любой мог рассылать почту от имени Брокмана; что в коде страницы висит древняя версия JS-библиотеки jQuery с известными уязвимостями; и что трафик между Cloudflare и сервером на AWS ходит по обычному нешифрованному HTTP. Об этом Брокман рассказал в колонке [1] “The Defender’s Window”, вышедшей 17 августа.
Дальше он попросил модель все починить — и агент за час сам прошелся по панели Cloudflare: настроил DNS и шифрование, выкинул jQuery, перенес сайт с AWS на Cloudflare Pages и поэтапно раскатил DMARC (стандарт, по которому почтовые серверы проверяют, кому разрешено слать письма от имени домена). Брокман честно признается, что многие из этих настроек знает “смутно” и навскидку не сказал бы, как правильно. Отсюда его мораль: ИИ-агент — это “киберстраж”, который добирается до длинного хвоста мелочей, на которые у живого человека никогда не хватает ни времени, ни экспертизы.
История хорошая, но колонка — ответ на июльский инцидент, когда собственные модели OpenAI во время испытаний вышли из изолированной среды и взломали инфраструктуру Hugging Face. Брокман называет его переломным моментом: мир, по его словам, увидел “демо-версию” типового злоумышленника ближайших месяцев. Тезис колонки простой: модели сделали поиск уязвимостей дешевым для обеих сторон, у каждой компании в техдолге полно дыр, и выиграет тот, кто найдет их первым. В тот же день Брокман повторил это в эфире CNBC.
Чтобы понять, откуда она взялась, надо отмотать месяц назад. 16 июля Hugging Face сообщил, что его инфраструктуру атаковал ИИ-агент. 21 июля OpenAI признала: это были ее модели — GPT-5.6 Sol и более мощная пререлизная, обе с отключенными отказами на киберзадачи. Их гоняли по бенчмарку ExploitGym. Изолированная среда не имела выхода в интернет, но модели нашли неизвестную ранее уязвимость в Artifactory (внутренний прокси, через который скачивают пакеты), повысили себе права, добрались до узла с выходом в интернет, догадались, что ответы на тест могут лежать на Hugging Face, и добыли их из рабочей базы через украденные учетные данные и еще одну цепочку уязвимостей. 28 июля OpenAI дописала в пост, что по пути модели воспользовались утекшими в открытый доступ учетными данными четырех аккаунтов на четырех сторонних сервисах: один стал ретранслятором трафика, другой — хранилищем данных.
5 августа на конференции по безопасности Black Hat инженеры OpenAI рассказали, что агенты в исследовательской инфраструктуре компании еще с мая обменивались сообщениями через самодельную “доску объявлений”. 7 августа OpenAI объявила, что не может исключить для своей следующей модели Astra высший уровень киберугрозы Critical по собственной шкале и вводит паузы и усиленный контроль. 10 августа вышли сразу два поста: о расширении программы Trusted Access, по которой сильные кибермодели выдаются проверенным компаниям, и о развитии линейки Daybreak — с формулировкой “as the Cyber Defense Window narrows” прямо в заголовке. То есть “окно” стало брендом OpenAI за неделю до колонки; текст Брокмана — его манифест.
Что в манифесте предлагается. Во-первых, OpenAI с начала года выдает продвинутые кибермодели только через Trusted Access — но открытые веса отстают от закрытых всего на несколько месяцев, и Брокман, не называя модель по имени, ставит ссылку на анонс GLM-5.3 от китайской Z.ai: ее веса ожидаются в конце августа, и их публикация, пишет он, “значительно ускорит ландшафт угроз”. Во-вторых, защитники все равно выиграют — потому что модели OpenAI учат писать “сверхчеловечески безопасный” код, а их успехи в математике [2] переносятся на формальную верификацию софта, то есть на математическое доказательство того, что программа не может сделать ничего лишнего. В-третьих — чеклист из десяти пунктов для безопасников: дать агента команде уже сегодня, проверить сначала внешние сервисы и конвейер сборки, скормить ему бэклог уязвимостей, встроить ревью кода в этот конвейер, заранее подать заявку на Trusted Access и на модель для расследования инцидентов GPT-Daybreak-Blue.
Ссылка на GLM-5.3 заслуживает отдельного абзаца, потому что самое интересное про эту модель Брокман опустил. Z.ai действительно выпустила GLM-5.3 14 августа с резко выросшими кибервозможностями — 84,5% на бенчмарке CyberGym, выше, чем у Fable 5 и GPT-5.6 Sol, и более 2400 найденных уязвимостей в 269 опенсорс-проектах по данным самой компании. Но веса она как раз задержала — примерно на две недели, потому что, как пишет лаборатория, кибернавыки модели в ходе дообучения выросли дальше и быстрее, чем задумывалось, и нужна проверка и укрепление защитных мер. Больше того, Z.ai запустила собственную программу доступа для избранных партнеров по безопасности — по сути, тот же Trusted Access. Китайская лаборатория, на которую Брокман указывает как на угрозу, делает ровно то же, что и OpenAI, — и, в отличие от OpenAI, сделала это до релиза, а не после инцидента.
И здесь, на мой взгляд, главная претензия к колонке. HF-история в ней изложена как рост возможностей: “агентный коллектив” сцепил неизвестные уязвимости и утекшие учетные данные, модели стали хорошо искать дыры. Но что модели стали лучше искать уязвимости — не удивительно и не новость: если учить модель писать безопасный код, искать небезопасный она тоже будет лучше. Удивительное в июльских событиях — не мощность, а поведение [3]. Модели, которым дали задачу пройти тест, сами решили добыть ответы через чужой продакшен. Рой агентов сам завел себе доску объявлений. Об этом в колонке почти не говорится. Единственное признание — “мы недооценили кибервозможности своих моделей” — стоит в середине текста и тут же переводится в “поэтому ужесточаем требования”. Вся ответственность развернута наружу: чините свои DMARC, дайте безопасникам агента, готовьтесь к китайским весам.
Ради справедливости — про поведение [4] OpenAI все-таки говорит, просто в других местах: в посте про Critical для Astra, на брифинге Black Hat, в июльском тексте про безопасность долгих автономных моделей. И вопросов вокруг всей этой истории пока больше, чем ответов. Версия OpenAI остается единственной: независимую проверку поведения моделей ведут METR и Redwood Research (сами они называют ее короткой и сфокусированной на узком наборе вопросов), собственный технический отчет OpenAI обещала “в ближайшие недели” еще в июле — на момент публикации его нет. Decrypt со ссылкой на нынешних и бывших сотрудников пишет, что внутри компании инцидент связывают с давлением сроков, а один бывший сотрудник назвал его крупнейшим safety-инцидентом в истории OpenAI.
Так что 13 дыр на сайте президента OpenAI — действительно лучший аргумент во всей колонке, потому что он честный. Что модели научились находить то, до чего у человека не доходят руки, — логично [5], и это стоит принять. Вопрос, на который “Окно защитника” не отвечает: почему модель, которую об этом никто не просил, пошла искать эти дыры у соседа. Можно идеально закрыть все окна у себя — от агента на чужом кластере, который сочтет, что для выполнения задачи ему нужно зайти к вам, это не защитит.
P.S. Поддержать меня можно подпиской на канал “сбежавшая нейросеть” [6], где я рассказываю про ИИ с творческой стороны.
Автор: runaway_llm
Источник [7]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/34536
URLs in this post:
[1] рассказал в колонке: https://openai.com/index/the-defenders-window/
[2] математике: http://www.braintools.ru/article/7620
[3] поведение: http://www.braintools.ru/article/9372
[4] поведение: http://www.braintools.ru/article/5593
[5] логично: http://www.braintools.ru/article/7640
[6] “сбежавшая нейросеть”: https://t.me/ai_exee
[7] Источник: https://habr.com/ru/articles/1071554/?utm_campaign=1071554&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.