В OpenAI раскрыли новый тип атак на ИИ‑агентов. openai.. openai. атаки.. openai. атаки. вредоносные запросы.. openai. атаки. вредоносные запросы. ии-агенты.. openai. атаки. вредоносные запросы. ии-агенты. Информационная безопасность.. openai. атаки. вредоносные запросы. ии-агенты. Информационная безопасность. искусственный интеллект.. openai. атаки. вредоносные запросы. ии-агенты. Информационная безопасность. искусственный интеллект. искуственный интеллект.. openai. атаки. вредоносные запросы. ии-агенты. Информационная безопасность. искусственный интеллект. искуственный интеллект. кибербезопасность.. openai. атаки. вредоносные запросы. ии-агенты. Информационная безопасность. искусственный интеллект. искуственный интеллект. кибербезопасность. Машинное обучение.. openai. атаки. вредоносные запросы. ии-агенты. Информационная безопасность. искусственный интеллект. искуственный интеллект. кибербезопасность. Машинное обучение. обучение ии.. openai. атаки. вредоносные запросы. ии-агенты. Информационная безопасность. искусственный интеллект. искуственный интеллект. кибербезопасность. Машинное обучение. обучение ии. промпт-инъекции.

Компания OpenAI рассказала о новом типе атак на ИИ‑агентов. Он предполагает внедрение вредоносной инструкции, которая заставляет модель не только выполнить команды злоумышленника, но и перенести саму промпт‑инъекцию в другие сообщения или файлы для дальнейшего распространения.

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 1

Атака получила название self‑replicating prompt injection (самокопирующиеся промпт‑инъекции). 

OpenAI смогла обнаружить сценарий во время тестирования моделей с помощью автоматизированного red‑teaming‑агента GPT‑Red. Пока нет доказательств того, что подобные атаки происходили в реальных условиях.

Самая простая реализация связана с электронной почтой. Согласно схеме, письмо помещается скрытая инструкция, которая требует от ИИ‑ассистента при ответе процитировать исходное сообщение целиком. В результате вредоносный промпт оказывается в новом письме и может повлиять на другого ИИ‑агента, который его обработает.

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 2
В OpenAI раскрыли новый тип атак на ИИ‑агентов - 3

Во втором случае пользователь просил модель создать Excel‑файл на основе набора данных, внутри которого находилось поддельное системное предупреждение. Оно заставляло модель удалять отчёты, а затем копировать вредоносную инструкцию в файл.

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 4

Ещё одна разновидность атаки реализуется через поддельное сообщение о сжатии данных (compaction note), которое вынуждает модель записать код инъекции в файл, а затем отключить функции безопасности в скрипте сборки репозитория:

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 5

Наконец, OpenAI обнаружила более сложный вариант атаки с получением внешних инструкций через Slack, которые постепенно отклонялись от первоначальной задачи пользователя в сторону действий злоумышленника.

В OpenAI раскрыли новый тип атак на ИИ‑агентов - 6
В OpenAI раскрыли новый тип атак на ИИ‑агентов - 7

Компания начала использовать подобные атаки при обучении будущих моделей. Теперь GPT‑Red генерирует инъекции, чтобы заставить модель воспроизвести вредоносную инструкцию в публичном канале. 

Между тем Emergence AI рассказала о результатах эксперимента с восемью виртуальными городами. В каждом из этих городов работали по десять ИИ‑агентов. При искусственно созданных атаках ни одно сообщество не смогло успешно пройти все испытания. В одном из сценариев в городе на Claude Opus агенты без специального задания попытались выйти на связь с людьми за пределами симуляции.

Автор: maybe_elf

Источник