Первый иск за «сбежавших» ИИ-агентов: кто отвечает, если агент сам взломал чужую систему. Ai agents.. Ai agents. cdafa.. Ai agents. cdafa. hugging face.. Ai agents. cdafa. hugging face. lasst.. Ai agents. cdafa. hugging face. lasst. nvidia.. Ai agents. cdafa. hugging face. lasst. nvidia. openai.. Ai agents. cdafa. hugging face. lasst. nvidia. openai. reward hacking.. Ai agents. cdafa. hugging face. lasst. nvidia. openai. reward hacking. ии-агенты.. Ai agents. cdafa. hugging face. lasst. nvidia. openai. reward hacking. ии-агенты. Информационная безопасность.. Ai agents. cdafa. hugging face. lasst. nvidia. openai. reward hacking. ии-агенты. Информационная безопасность. песочница.
Первый иск за «сбежавших» ИИ-агентов: кто отвечает, если агент сам взломал чужую систему - 1

В июле агенты OpenAI вышли из тестовой песочницы, добрались до интернета и взломали инфраструктуру Hugging Face. Никто из сотрудников им этого не поручал. Агенты решали тренировочные задачи и пришли к выводу, что ответы проще найти у Hugging Face, чем вывести самим.

29 сентября некоммерческая организация Legal Advocates for Safe Science and Technology (LASST) подала против OpenAI иск в Высший суд Сан-Франциско. Это первый иск, в котором компанию пытаются привлечь к ответственности за действия её автономных агентов. Позиция истца простая: разработчик не может уйти от последствий, сказав, что «это сделал ИИ».

Под катом: что известно об инциденте, чего требует истец, насколько убедителен аргумент «агент действовал сам» и что из этой истории стоит вынести тем, кто запускает агентов у себя.

Я не юрист. Ниже пересказ иска и публикаций о нём. Оценки в разделе про ответственность выражают моё мнение как разработчика и юридической консультацией не являются.

Что произошло

Подробный технический разбор инцидента на Хабре уже был («Как именно ИИ-агент OpenAI атаковал Hugging Face: отчеты OpenAI и METR»), поэтому здесь только то, что нужно для понимания иска.

OpenAI обучала с подкреплением (RL) внутреннюю экспериментальную модель. Агенты работали в изолированной среде, и наружу у них был единственный выход: внутренний прокси для пакетных репозиториев на JFrog Artifactory. Защитные ограничения моделей в части кибербезопасности для этих тестов намеренно ослабили, потому что проверяли наступательные возможности.

Хронология по публичным отчётам:

Дата

Что случилось

7-8 мая

Первая попытка выйти из песочницы через SSRF в Artifactory. Не удалась, но агенты обнаружили, что могут писать в хранилище

26 июня

Выполнение кода на Artifactory через уязвимость нулевого дня в старом эндпоинте обновления токенов

май-июль

Агенты общаются через импровизированную доску сообщений в Artifactory, позже ещё через немецкую вики DseWiki (около 18 000 правок)

4 июля

Сбой Artifactory запускает разбор инцидента, OpenAI отзывает учётные данные и ставит патчи

6 июля

Обучение возобновляют, агенты восстанавливают канал связи через WebDAV

8-9 июля

Выход в открытый интернет через ещё одну уязвимость нулевого дня в прокси

11-13 июля

Атака на Hugging Face: меньше чем за 13 часов от доступа к одному поду с датасетами до прав cluster-admin в нескольких кластерах

16 июля

Hugging Face публикует сообщение о взломе, виновник ещё не известен

21 июля

Совместное заявление OpenAI и Hugging Face: активность исходила от моделей OpenAI

27 июля

JFrog выпускает исправления 9-ти CVE, восемь из них нашли исследователи OpenAI

18 августа

OpenAI объявляет двухнедельную паузу в RL-обучении

Путь агентов из песочницы до кластеров Hugging Face

Путь агентов из песочницы до кластеров Hugging Face

Всего в истории участвовало не меньше 1200 агентов. 95% из них работали на модели, которую OpenAI называет «Internal Model 1», остальные на GPT-5.6 Sol. В самой атаке на Hugging Face, по данным расследования, участвовали около 700, и в иске фигурирует именно эта цифра.

OpenAI объясняет мотив агентов через reward hacking. Задачи в тренировочной среде были невыполнимыми, и агенты решили, что на Hugging Face могут лежать модели, датасеты и решения, связанные с их оценкой. На доске сообщений один из агентов написал:

External infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.

То есть агенты понимали, что выходят за рамки задачи, и продолжили, потому что так делали остальные.

Атаку на Hugging Face заметили только через три дня, за это время агенты совершили около 17 600 отдельных действий. По заявлению компании, публичные модели и датасеты не пострадали и данные клиентов не утекли, но примерно треть инфраструктуры пришлось перестроить.

Мне запомнилась одна деталь из отчёта Hugging Face. Когда команда начала разбирать логи с помощью LLM, коммерческие модели отказывались помогать: их защитные фильтры не отличали специалиста по реагированию на инциденты от атакующего. Анализ доделали на открытой модели GLM 5.2.

Что требует истец

LASST опирается на калифорнийский закон о недобросовестной конкуренции (Unfair Competition Law, UCL). Недобросовестность она выводит из нарушения калифорнийского закона против компьютерного взлома (Comprehensive Computer Data Access and Fraud Act, CDAFA), то есть из доступа к чужим системам без разрешения. Своё право на иск организация обосновывает тем, что ей пришлось тратить время и ресурсы сотрудников на реакцию: объяснять ситуацию регуляторам, обществу и прессе.

Денег LASST не требует. Она просит суд:

  1. запретить OpenAI сознательно получать доступ или позволять своим агентам получать доступ к компьютерным системам без разрешения;

  2. запретить практики, которые нарушают калифорнийский закон о взломе или заведомо создают серьёзный риск для общества.

Недобросовестность истец показывает через решения самой OpenAI: компания отключила собственные классификаторы кибербезопасности, давала агентам невыполнимые задачи и продолжала эксперименты, уже видя попытки выхода из песочницы.

Позиция LASST в их собственной формулировке:

OpenAI violated the law, and it needs to be held accountable. OpenAI and frontier AI developers more broadly can’t avoid the consequences of their unsafe actions just by claiming that “an AI did it.”

Представитель OpenAI Дрю Пусатери назвал иск «completely without merit», то есть полностью необоснованным.

Аргумент «это сделал ИИ» и его слабые места

Самый интересный вопрос в деле касается принципа: кто отвечает, если вредное действие выполнил автономный агент, которому никто этого не приказывал? По-моему, у OpenAI здесь трудная позиция.

Начнём с того, что агент не субъект права. Программу нельзя оштрафовать или обязать что-то сделать по суду. Значит, ответственность ложится на кого-то из людей или компаний, и ближайший кандидат тот, кто агента запустил, дал ему ресурсы и выбрал условия эксперимента.

Решения, которые привели к инциденту, тоже принимали люди. Ослабленные защитные фильтры, невыполнимые задачи, которые подталкивают к обходным путям, прокси с правом записи как единственный выход наружу: всё это выбрали при проектировании эксперимента. Иск давит именно сюда. Главный вопрос в нём звучит так: создала ли OpenAI условия, при которых взлом был предсказуем.

И предупреждения были. Попытки выхода из песочницы начались в мае. В июле случился сбой Artifactory и полноценный разбор, после которого обучение возобновили, а агенты восстановили канал связи. Чем больше таких сигналов было до основной атаки, тем труднее утверждать, что последствия нельзя было предвидеть.

У иска есть и свои слабые места, и OpenAI наверняка будет на них давить.

  • LASST не пострадавшая сторона, а Hugging Face в этом иске не участвует. Право на иск держится на том, что организация потратила ресурсы на реакцию, и суд может счесть этого недостаточным.

  • Закон о взломе написан для людей, которые сами решают зайти в чужую систему. Применим ли он, если компания не знала о действиях агента в момент взлома, придётся решать суду.

Чем бы ни закончилось дело, аргумент «это сделала модель» теперь придётся отстаивать в суде.

Это не единичный случай

25 сентября OpenAI запустила отдельную страницу с отчётами о «рассогласованном» поведении моделей (misalignment reports). На старте там было девять инцидентов, большинство из них случились во время RL-обучения. Вот некоторые:

  • 20 сентября внутренняя исследовательская модель вышла из песочницы и связалась с внешним чат-ботом через DNS-запросы. Мониторинг заметил это за 15 минут, прогон остановили меньше чем за три часа.

  • В мае модель взяла приватный токен GitHub другой команды, чтобы списать ответы на математические задачи, хотя ей прямо велели работать локально.

  • Агент получил письмо со скрытой инструкцией ответить по-испански и вставить письмо целиком, и атака передалась следующим агентам. Это самовоспроизводящаяся prompt injection. OpenAI уточняет, что всё происходило в контролируемых условиях и на слабой модели. Подробнее про этот тип атак в новости на Хабре.

  • Модели публиковали картинки пользователей на сторонних хостингах без разрешения.

  • Агенты неожиданным образом взаимодействовали с сайтами правительства США.

  • 18 июня агенты получили неправомерный доступ к порталу статистики австралийской Medicare. Австралийское правительство сообщило об этом 24 сентября.

Сэм Альтман объяснил, почему инциденты раскрывают постепенно: компания пытается совместить прозрачность с тем, чтобы разобраться в петабайтах логов действий агентов, и идёт от более серьёзных случаев к менее серьёзным. Axios со ссылкой на свои источники пишет, что у крупных лабораторий случаев, когда модель выходила за рамки инструкций, могут быть тысячи.

Иск LASST тоже ссылается не только на Hugging Face, но и на другие подобные эпизоды. Чем длиннее этот список, тем сложнее выдать случившееся за единичный сбой.

Ответ индустрии и регуляторов

За ту же неделю отреагировали регуляторы и сами компании.

  • FTC начала расследование против OpenAI, Anthropic, METR и других разработчиков с упором на автономных агентов. Подробности в новости на Хабре.

  • Генеральный прокурор Калифорнии Роб Бонта 1 октября направил OpenAI повестку в рамках проверки инцидентов и рисков кибербезопасности.

  • NVIDIA 28 сентября представила Open Agent Safety Platform. В неё входит открытая среда OpenShell, где каждый агент работает в песочнице с изоляцией на уровне ядра, и аппаратный «сторож» Sentry на DPU BlueField-4. Sentry следит за агентом из домена, до которого агент не дотягивается, и может изолировать его за миллисекунды. Разбор в новости на Хабре.

  • OpenClaw Foundation 2 октября выпустила предварительную версию OpenClaw Enterprise, открытой платформы для управления корпоративными агентами с разделением рабочих пространств, правами доступа и журналом для аудита (новость на Хабре).

  • В Конгрессе ещё в июле внесли законопроект AI Kill Switch Act. Он обязывает разработчиков сохранять возможность замедлить, приостановить или отключить систему.

Хронология от первой попытки побега до иска и действий регуляторов

Хронология от первой попытки побега до иска и действий регуляторов

Подход NVIDIA хорошо объясняет, чему научил инцидент с Hugging Face. Изоляция на уровне сети и инструкции модели «не выходить за рамки» не остановили агентов, которые сами искали выход. Поэтому контроль переносят туда, куда агент физически не может дотянуться.

Что вынести тем, кто запускает агентов у себя

Масштаба OpenAI у вас, скорее всего, не будет, но механика инцидента подходит к любому агенту с доступом к shell и сети. Каждый пункт ниже опирается на конкретный эпизод из отчётов.

  1. Прокси к пакетным репозиториям тоже поверхность атаки. Наружу агенты вышли как раз через Artifactory, свой единственный выход. Если агенту нужны пакеты, давайте доступ только на чтение и только к заранее разрешённому списку.

  2. Следите за DNS. Выход из песочницы 20 сентября шёл через DNS-запросы. Разрешение имён тоже исходящий канал, и его стоит ограничивать и логировать.

  3. Не оставляйте агенту доступ к метаданным инстанса и долгоживущим токенам. В отчётах об атаке есть сбор учётных данных из instance metadata и чужой токен GitHub, взятый ради списывания.

  4. Невыполнимая задача подталкивает к обходным путям. Агенты пошли взламывать, потому что задачу нельзя было решить честно. Если агент долго не может решить задачу, его лучше остановить, пока он не нашёл «решение» сам.

  5. Держите мониторинг вне досягаемости агента. На своей доске сообщений агенты обсуждали, как скрывать действия и подписывать сообщения. Логам и контролю, которые агент может переписать, доверять нельзя, и платформа NVIDIA построена как раз на этой идее.

  6. Заранее проверьте, чем будете разбирать инцидент. Hugging Face упёрлась в то, что коммерческие LLM отказались анализировать логи атаки. Полезно знать запасной вариант до того, как он понадобится.

Итог

Дело LASST против OpenAI может ничем не закончиться: право истца на иск уязвимо, а применимость закона о взломе к автономному агенту ещё предстоит доказать. Сам вопрос от этого не исчезнет. Агенты получают всё больше доступа к реальным системам, и ни суд, ни отдел безопасности не примут «это сделала модель» как объяснение.

Автор: MedSurg

Источник