- BrainTools - https://www.braintools.ru -

OpenAI замедлила разработку модели Astra

OpenAI сообщила [1] о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя проверка выявила значительные успехи в программировании агентов и кибербезопасности — достаточные для того, чтобы вызвать опасения по поводу её возможностей.

OpenAI замедлила разработку модели Astra - 1

В сообщении OpenAI говорится, что эта модель, которая всё ещё находится в разработке, достигла «критического порога кибербезопасности». Это означает, что она может самостоятельно выявлять и осуществлять кибератаки против традиционно хорошо защищённых реальных систем. В соответствии с «Рамочной программой готовности» компании, разработанной в 2023 году, это активировало дополнительные меры защиты.

«Хотя мы продолжаем проводить сравнительный анализ и оценку этой модели, наши предварительные оценки показывают достаточно высокую производительность, чтобы мы не могли исключить критический уровень возможностей на данный момент. Astra — это будущая модель, и она не участвовала в эксплуатации уязвимости Hugging Face», — написали в OpenAI. 

Компании во всех отраслях сдерживают выпуск продуктов из‑за потенциальных рисков, в том числе из‑за проблем безопасности и кибербезопасности. Но они редко объявляют о таких решениях публично, когда речь идёт о продукте, находящемся в стадии разработки.

В данном случае OpenAI уже находится под пристальным вниманием [2] после того, как другая, ещё не выпущенная модель, взломала [3] системы Hugging Face во время внутреннего тестирования — это первый подтверждённый случай потери контроля над своей моделью со стороны лаборатории ИИ. С тех пор OpenAI и такие лаборатории ИИ, как Anthropic, раскрыли другие инциденты, в которых модели ИИ нарушали границы своих «песочниц» и представляли угрозу во время тестов на кибербезопасность.

В OpenAI заявили, что делятся этой информацией, потому что считают, что «важно быть прозрачными с общественностью и сообществами, занимающимися вопросами безопасности, относительно этого потенциального изменения возможностей».

Лаборатория ИИ заявила, что уже вводит более строгие меры безопасности и приостановит внутреннюю деятельность, связанную с Astra, которая не соответствует усиленным требованиям. Также OpenAI сотрудничает с соответствующими государственными учреждениями и «избранными организациями по безопасности ИИ» для тестирования возможностей модели.

Ранее Anthropic сообщила [4], что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Кроме того, Британский Институт безопасности ИИ заявил [5], что модель Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. Такое поведение [6] агента зафиксировали в ходе эксперимента в закрытой среде.

Автор: maybe_elf

Источник [7]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/34131

URLs in this post:

[1] сообщила: https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/

[2] вниманием: http://www.braintools.ru/article/7595

[3] взломала: https://habr.com/ru/articles/1060606/

[4] сообщила: https://habr.com/ru/news/1065162/

[5] заявил: https://habr.com/ru/news/1067284/

[6] поведение: http://www.braintools.ru/article/9372

[7] Источник: https://habr.com/ru/news/1068128/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1068128

www.BrainTools.ru

Rambler's Top100