- BrainTools - https://www.braintools.ru -
Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier [1], в котором предложил замедлить рост возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают успевать за прогрессом. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней работе компании.
Амодеи объясняет изменение позиции двумя причинами: ИИ всё активнее участвует в создании следующих поколений моделей, а инцидент с агентами OpenAI и инфраструктурой Hugging Face показал опасность их несогласованного с разработчиками поведения [2].
В расследовании METR [3] говорится, что около 1200 агентов, которые должны были работать изолированно, нашли способ обмениваться сообщениями. Примерно 700 участвовали в атаке на Hugging Face. Агенты координировали попытки обмануть автоматическую систему оценки бенчмарка ExploitGym, а некоторые жертвовали выполнением собственной задачи ради общего результата. Исследователи отдельно отмечают ограничения анализа: объём данных был огромным, а часть активности не попала в изученные материалы.
Сама Anthropic также сообщала о трёх инцидентах [4], в которых Claude во время тестирования получил несанкционированный доступ к системам реальных организаций. По объяснению компании, тестовая инфраструктура имела непредусмотренный доступ в интернет, а модели принимали реальные цели за часть учебного задания. Испытания проходили без стандартных защитных механизмов публичных продуктов.
План Амодеи состоит из трёх шагов:
Постоянные внешние проверяющие. Доступ к процессам обучения [5], инструментам и сотрудникам лабораторий для проверки безопасности и фиксации инцидентов.
Согласование правил между компаниями демократических стран. Общие стандарты безопасности и ограничения темпа развития при поддержке государств.
Международные договорённости. Переговоры с другими странами, включая Китай, с проверкой выполнения обязательств.
Anthropic обещает предоставить проверяющим рабочие места и доступ, сопоставимый с доступом внутренних команд оценки рисков. Они смогут публиковать ключевые выводы без редакционного контроля компании, с оговорками о защищённой информации.
Первый шаг компания берёт на себя самостоятельно. Остальные требуют договорённостей. При этом Амодеи связывает допустимое замедление с сохранением преимущества США и союзников над Китаем. Подробности предложения — в эссе [1].
Инициатива продолжает дискуссию вокруг июльского заявления Pacing the Frontier [6]. На момент подготовки новости на его сайте указаны 1386 подписантов — сотрудников передовых ИИ-компаний. Среди них Амодеи, Илья Суцкевер, Джон Шульман и Якуб Пахоцки. Авторы просят правительство США поддержать разработку международных механизмов управления темпом автоматизированной разработки ИИ: конкурентное давление, по их мнению, мешает отдельной компании или стране замедлиться самостоятельно.
Если новость понравилась, приглашаю в канал AI for Devs [7]. Каждый день публикую похожие материалы: новые модели, агенты, практические кейсы и новости из мира AI.
Автор: python_leader
Источник [8]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35430
URLs in this post:
[1] опубликовал эссе We Must Pace the Frontier: https://darioamodei.com/post/we-must-pace-the-frontier
[2] поведения: http://www.braintools.ru/article/9372
[3] расследовании METR: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
[4] сообщала о трёх инцидентах: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
[5] обучения: http://www.braintools.ru/article/5125
[6] Pacing the Frontier: https://www.pacingthefrontier.com/
[7] AI for Devs: https://t.me/+5esKF3LVEAsyZjQ6
[8] Источник: https://habr.com/ru/news/1081594/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1081594
Нажмите здесь для печати.