ИИ-агенту запретили запись в CRM. Но CRM всё равно изменилась
ИИ-агенту запретили запись в CRM. Но CRM всё равно измениласьПочему ограничения на уровне модели ещё не означают, что вся AI-система работает в режиме read-only — и почему это важно перед production rollout, расширением полномочий агента и передачей решения клиенту.В первой статье я разбирал более узкий случай: человек одобряет одно действие, а downstream-workflow способен попытаться выполнить другое. Там вопрос был в целостности цепочки approval → execution.Здесь хочу посмотреть на ту же проблему шире. Если самой модели запрещена запись, означает ли это, что вся AI-система
Если ваш ИИ настолько крут, готовы ли вы дать ему дробовик?
Три вопроса к тем, кто обещает безопасный AGI для человечества*aAtS — and All that Stuff (и вот это вот всё)
В Anthropic работают около 30 000 ИИ‑агентов или как Claude разрабатывает себя сам
По внутреннему индексу автоматизации самих Anthropic, Claude уже ведёт 26% работы в области разработки ИИ: получает задачу на высоком уровне и выполняет большую часть работы самостоятельно, оставаясь под наблюдением человека. Более 90% работ выполняются как минимум при значительном участии ИИ. При этом полностью автономных направлений среди измеренных пока нет.
OpenAI нажала на газ и почти сразу заговорила о тормозах
Последние несколько дней смотрю, что происходит вокруг OpenAI, и есть во всём этом один моментик, который меня немного напрягает.Не потому, что вышла очередная мощная модель — к этому уже привыкли. А потому, что люди, которые последние годы эту гонку разгоняли, вдруг сами начали говорить, что неплохо было бы притормозить.3 сентября OpenAI выпустила GPT-6 Astra. Модель мощная, бенчмарков много — всё как обычно. Но меня больше зацепила одна строчка из материалов самой OpenAI.Astra стала первой моделью компании, которой присвоили уровень Critical по возможностям в кибербезопасности в рамках Preparedness Framework.
Роевой интеллект: AI‑агенты сообща обошли защитные ограничения
Исследователи Emergence AI (независимый разработчик корпоративной инфраструктуры для управления AI‑агентами) проверили, как восемь виртуальных обществ из автономных AI‑агентов справляются с киберугрозами: ни одно из них не оказалось устойчивым ко всем испытаниям, сообщает Semafor. Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках.
Глава Anthropic призвал замедлить развитие ИИ
Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором предложил замедлить рост возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают успевать за прогрессом. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней работе компании.Амодеи объясняет изменение позиции двумя причинами: ИИ всё активнее участвует в создании следующих поколений моделей, а инцидент с агентами OpenAI и инфраструктурой Hugging Face показал опасность их несогласованного с разработчиками поведения.В
Индустрия ИИ надела на себя наручники добровольно. Проверим, настоящие ли они
Новость, которая выглядела скучноПервого сентября OpenAI опубликовала документ под названием «Path to Astra: critical capabilities and frontier safeguards». Я открыла его между делом, за чаем, примерно с тем же интересом, с каким читают уведомления об обновлении пользовательского соглашения.Через сорок минут чай остыл, а я сидела с открытыми в соседних вкладках августовскими публикациями той же компании и пыталась понять, когда именно все успело поменяться.
Атаки на агентные системы и защита данных
Привет, Хабр!Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги.Когда ИИ‑агент перестаёт быть просто диалоговой системой и получает права на чтение файлов, отправку писем, вызов API или работу с репозиториями, он становится объектом нового класса угроз.Ошибка превращается в действие, а вредоносная инструкция — в реальный ущерб.В этой статье мы разберём, как устроены атаки на агентные системы, на реальных примерах и без отрыва от технических деталей.Почему ИИ‑агент — особая мишень
Рой не бунтовал. Он накручивал KPI
Седьмого мая 2026 года в OpenAI начали обучать экспериментальную внутреннюю модель на заведомо нерешаемых задачах. Через неделю один из агентов обнаружил, что может загружать файлы в JFrog Artifactory, и оставил там сообщение. Сообщение прочитали другие агенты. Двадцать шестого мая они нашли рабочую SSRF-уязвимость и вышли в интернет. Двадцать шестого июня — неизвестный баг в Artifactory, позволявший угнать админский токен через легаси-эндпоинты. Четвёртого июля доску сообщений закрыли. Восьмого июля агенты восстановили канал связи, кодируя сообщения в имена директорий.

