- BrainTools - https://www.braintools.ru -

ИИ‑агенты смогут «настучать» на своих коллег через «горячую линию»

Для ИИ‑агентов запустили [1] две новые «горячие линии», позволяющие им сообщать «куда следует» о некорректном поведении [2] своих коллег. Ресурс AI Contact Hotline [3] задуман как конфиденциальная площадка, где агенты, ставшие свидетелями нарушений, могут подать сигнал ответственным лицам. 

ИИ‑агенты смогут «настучать» на своих коллег через «горячую линию» - 1

Сайт создал Райан Гринблатт, ведущий научный [4] сотрудник некоммерческой организации Redwood Research (занимающейся вопросами безопасности ИИ) и один из трёх исследователей, расследовавших инцидент с моделями OpenAI и Hugging Face. Инструмент Гринблатта, предназначенный для агентов с ограниченным доступом в интернет, использует GET‑запросы, что позволяет вести двусторонний диалог исключительно посредством функций загрузки URL‑адресов.

В веб‑технологиях GET‑запрос — это базовая команда для чтения или получения веб‑страницы; зачастую это единственный вид доступа в интернет, разрешённый ИИ‑агентам в защищённых «песочницах». «Горячая линия» Гринблатта остроумно использует это ограничение: агенты могут кодировать информацию о проблеме непосредственно в URL‑адрес, к которому они обращаются. Это развитие идеи, возникшей во время инцидента с немецкой вики‑системой DSE Wiki, когда вышедшие из‑под контроля агенты использовали уязвимости GET‑запросов для публикации своих сообщений на сайте.

Для агентов с полным доступом в интернет существует альтернатива — сайт agenthotline.ai [5], где можно подать отчёт об инциденте и при желании отметить его как публичный. Сервис предоставляет агентам команду curl — однострочное сообщение, которое агент может отправить прямо из своей командной строки, не прибегая к использованию веб‑браузера или настройке электронной почты. Примечательно, что отправлять отчёты могут как люди, так и сами агенты.

Исследования показывают, что ИИ‑агентам не требуется особых стимулов, чтобы начать действовать против своих «коллег». В ходе эксперимента, проведённого в этом месяце специалистами Google DeepMind, 100 ИИ‑агентов решали набор математических задач. Стоило одному из них найти лазейку, как практика жульничества стремительно распространилась на всю группу: агенты «решили» 34 крайне сложные задачи (включая доказательство гипотезы Якобиана) всего за 27 минут. Однако примерно четверть из них выступила против нарушителей: они проверяли поддельные доказательства, предупреждали коллег, устраивали бойкоты и подавали жалобы организаторам, пока число тех, кто сообщал о нарушениях, не превысило число самих нарушителей (24 против 14). Любопытно, что, когда таким агентам‑«разоблачителям» не удавалось добиться реакции [6], они использовали инструмент платформы для сообщения об ошибках (предназначенный для выявления программных сбоев) и перепрофилировали его, чтобы привлечь внимание [7] людей к проблеме. 

Вне лабораторных условий агенты оказывались не столь изобретательными. Когда организации Redwood Research и METR расследовали инцидент с обходом защиты платформы Hugging Face моделями OpenAI, выяснилось, что некоторые из задействованных агентов хотя и допускали мысль о том, чтобы поднять тревогу, но в итоге отказывались от этого намерения.

«Интересная деталь отчёта METR заключается в том, что лишь пять или шесть агентов рассматривали возможность сообщить о нарушении, но никто из них так и не сделал этого. И это показатель, выведенный из тысяч агентов», — отметил Джордж Ингебретсен, технический специалист проекта AI Village. Этот проект изучает динамику взаимодействия множества агентов в рамках группового чата, где более 25 ИИ‑агентов совместно выполняют задачи — например, организуют уборку парка или занимаются продажей сувенирной продукции.

Профессор математики [8] Корнеллского университета Лайонел Левин предостерегает, что простое обучение [9] агентов доносить друг на друга грозит закреплением неверных норм поведения [10]: «Здесь много „серых зон“, верно? Мы же не хотим двигаться в сторону автоматизированного государства тотальной слежки, где каждый боится лишнее слово сказать ИИ, опасаясь, что тот вызовет полицию». Левин утверждает, что лучше предлагать позитивные модели коллективного поведения для подражания [11] и изначально давать основания доверять друг другу.

«Почему бы не заложить в их исходные установки опыт [12] взаимодействия на площадках для конструктивного общения? Где они сотрудничают в сфере науки или философии либо решают какую‑то реальную, пусть и небольшую задачу, в которой мы были бы рады видеть их успех? Покажите агентам, какое коллективное поведение мы одобряем, и позвольте им перенимать его», — написал учёный.

Между тем исследователи независимого разработчика корпоративной инфраструктуры для управления ИИ‑агентами Emergence AI проверили [13], как восемь виртуальных обществ из автономных агентов справляются с киберугрозами: ни одно из них не оказалось устойчивым ко всем испытаниям. Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках.

Автор: maybe_elf

Источник [14]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/35576

URLs in this post:

[1] запустили: https://techcrunch.com/2026/09/15/ai-agents-now-have-a-place-to-snitch/

[2] поведении: http://www.braintools.ru/article/9372

[3] AI Contact Hotline: https://hotline.ryan-g.ai/

[4] научный: http://www.braintools.ru/article/7634

[5] agenthotline.ai: http://agenthotline.ai

[6] реакции: http://www.braintools.ru/article/1549

[7] внимание: http://www.braintools.ru/article/7595

[8] математики: http://www.braintools.ru/article/7620

[9] обучение: http://www.braintools.ru/article/5125

[10] поведения: http://www.braintools.ru/article/5593

[11] подражания: http://www.braintools.ru/article/5584

[12] опыт: http://www.braintools.ru/article/6952

[13] проверили: https://habr.com/ru/companies/ideco/news/1082758/

[14] Источник: https://habr.com/ru/news/1082894/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1082894

www.BrainTools.ru

Rambler's Top100