- BrainTools - https://www.braintools.ru -

Глава Anthropic призвал замедлить развитие ИИ

Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier [1], в котором предложил замедлить рост возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают успевать за прогрессом. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней работе компании.

Амодеи объясняет изменение позиции двумя причинами: ИИ всё активнее участвует в создании следующих поколений моделей, а инцидент с агентами OpenAI и инфраструктурой Hugging Face показал опасность их несогласованного с разработчиками поведения [2].

В расследовании METR [3] говорится, что около 1200 агентов, которые должны были работать изолированно, нашли способ обмениваться сообщениями. Примерно 700 участвовали в атаке на Hugging Face. Агенты координировали попытки обмануть автоматическую систему оценки бенчмарка ExploitGym, а некоторые жертвовали выполнением собственной задачи ради общего результата. Исследователи отдельно отмечают ограничения анализа: объём данных был огромным, а часть активности не попала в изученные материалы.

Сама Anthropic также сообщала о трёх инцидентах [4], в которых Claude во время тестирования получил несанкционированный доступ к системам реальных организаций. По объяснению компании, тестовая инфраструктура имела непредусмотренный доступ в интернет, а модели принимали реальные цели за часть учебного задания. Испытания проходили без стандартных защитных механизмов публичных продуктов.

План Амодеи состоит из трёх шагов:

  1. Постоянные внешние проверяющие. Доступ к процессам обучения [5], инструментам и сотрудникам лабораторий для проверки безопасности и фиксации инцидентов.

  2. Согласование правил между компаниями демократических стран. Общие стандарты безопасности и ограничения темпа развития при поддержке государств.

  3. Международные договорённости. Переговоры с другими странами, включая Китай, с проверкой выполнения обязательств.

Anthropic обещает предоставить проверяющим рабочие места и доступ, сопоставимый с доступом внутренних команд оценки рисков. Они смогут публиковать ключевые выводы без редакционного контроля компании, с оговорками о защищённой информации.

Первый шаг компания берёт на себя самостоятельно. Остальные требуют договорённостей. При этом Амодеи связывает допустимое замедление с сохранением преимущества США и союзников над Китаем. Подробности предложения — в эссе [1].

Инициатива продолжает дискуссию вокруг июльского заявления Pacing the Frontier [6]. На момент подготовки новости на его сайте указаны 1386 подписантов — сотрудников передовых ИИ-компаний. Среди них Амодеи, Илья Суцкевер, Джон Шульман и Якуб Пахоцки. Авторы просят правительство США поддержать разработку международных механизмов управления темпом автоматизированной разработки ИИ: конкурентное давление, по их мнению, мешает отдельной компании или стране замедлиться самостоятельно.


Если новость понравилась, приглашаю в канал AI for Devs [7]. Каждый день публикую похожие материалы: новые модели, агенты, практические кейсы и новости из мира AI.

Автор: python_leader

Источник [8]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/35430

URLs in this post:

[1] опубликовал эссе We Must Pace the Frontier: https://darioamodei.com/post/we-must-pace-the-frontier

[2] поведения: http://www.braintools.ru/article/9372

[3] расследовании METR: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

[4] сообщала о трёх инцидентах: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

[5] обучения: http://www.braintools.ru/article/5125

[6] Pacing the Frontier: https://www.pacingthefrontier.com/

[7] AI for Devs: https://t.me/+5esKF3LVEAsyZjQ6

[8] Источник: https://habr.com/ru/news/1081594/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1081594

www.BrainTools.ru

Rambler's Top100