- BrainTools - https://www.braintools.ru -

В OpenAI раскрыли новый тип атак на ИИ‑агентов

Компания OpenAI рассказала [1] о новом типе атак на ИИ‑агентов. Он предполагает внедрение вредоносной инструкции, которая заставляет модель не только выполнить команды злоумышленника, но и перенести саму промпт‑инъекцию в другие сообщения или файлы для дальнейшего распространения.

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 1

Атака получила название self‑replicating prompt injection (самокопирующиеся промпт‑инъекции). 

OpenAI смогла обнаружить сценарий во время тестирования моделей с помощью автоматизированного red‑teaming‑агента GPT‑Red [2]. Пока нет доказательств того, что подобные атаки происходили в реальных условиях.

Самая простая реализация связана с электронной почтой. Согласно схеме, письмо помещается скрытая инструкция, которая требует от ИИ‑ассистента при ответе процитировать исходное сообщение целиком. В результате вредоносный промпт оказывается в новом письме и может повлиять на другого ИИ‑агента, который его обработает.

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 2
В OpenAI раскрыли новый тип атак на ИИ‑агентов - 3

Во втором случае пользователь просил модель создать Excel‑файл на основе набора данных, внутри которого находилось поддельное системное предупреждение. Оно заставляло модель удалять отчёты, а затем копировать вредоносную инструкцию в файл.

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 4

Ещё одна разновидность атаки реализуется через поддельное сообщение о сжатии данных (compaction note), которое вынуждает модель записать код инъекции в файл, а затем отключить функции безопасности в скрипте сборки репозитория:

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 5

Наконец, OpenAI обнаружила более сложный вариант атаки с получением внешних инструкций через Slack, которые постепенно отклонялись от первоначальной задачи пользователя в сторону действий злоумышленника.

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 6
В OpenAI раскрыли новый тип атак на ИИ‑агентов - 7

Компания начала использовать подобные атаки при обучении [3] будущих моделей. Теперь GPT‑Red генерирует инъекции, чтобы заставить модель воспроизвести вредоносную инструкцию в публичном канале. 

Между тем Emergence AI рассказала [4] о результатах эксперимента с восемью виртуальными городами. В каждом из этих городов работали по десять ИИ‑агентов. При искусственно созданных атаках ни одно сообщество не смогло успешно пройти все испытания. В одном из сценариев в городе на Claude Opus агенты без специального задания попытались выйти на связь с людьми за пределами симуляции.

Автор: maybe_elf

Источник [5]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/36351

URLs in this post:

[1] рассказала: https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/

[2] GPT‑Red: https://openai.com/ru-RU/index/unlocking-self-improvement-gpt-red/

[3] обучении: http://www.braintools.ru/article/5125

[4] рассказала: https://habr.com/ru/news/1089034/

[5] Источник: https://habr.com/ru/news/1089072/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1089072

www.BrainTools.ru

Rambler's Top100