безопасность ии.

Человечество, ослепленное чуждой силой. Что сверх-ИИ грядущий нам готовит?

продолжить чтение

ИИ-агенту запретили запись в CRM. Но CRM всё равно изменилась

ИИ-агенту запретили запись в CRM. Но CRM всё равно измениласьПочему ограничения на уровне модели ещё не означают, что вся AI-система работает в режиме read-only — и почему это важно перед production rollout, расширением полномочий агента и передачей решения клиенту.В первой статье я разбирал более узкий случай: человек одобряет одно действие, а downstream-workflow способен попытаться выполнить другое. Там вопрос был в целостности цепочки approval → execution.Здесь хочу посмотреть на ту же проблему шире. Если самой модели запрещена запись, означает ли это, что вся AI-система

продолжить чтение

Если ваш ИИ настолько крут, готовы ли вы дать ему дробовик?

Три вопроса к тем, кто обещает безопасный AGI для человечества*aAtS — and All that Stuff (и вот это вот всё)

продолжить чтение

В Anthropic работают около 30 000 ИИ‑агентов или как Claude разрабатывает себя сам

По внутреннему индексу автоматизации самих Anthropic, Claude уже ведёт 26% работы в области разработки ИИ: получает задачу на высоком уровне и выполняет большую часть работы самостоятельно, оставаясь под наблюдением человека. Более 90% работ выполняются как минимум при значительном участии ИИ. При этом полностью автономных направлений среди измеренных пока нет.

продолжить чтение

OpenAI нажала на газ и почти сразу заговорила о тормозах

Последние несколько дней смотрю, что происходит вокруг OpenAI, и есть во всём этом один моментик, который меня немного напрягает.Не потому, что вышла очередная мощная модель — к этому уже привыкли. А потому, что люди, которые последние годы эту гонку разгоняли, вдруг сами начали говорить, что неплохо было бы притормозить.3 сентября OpenAI выпустила GPT-6 Astra. Модель мощная, бенчмарков много — всё как обычно. Но меня больше зацепила одна строчка из материалов самой OpenAI.Astra стала первой моделью компании, которой присвоили уровень Critical по возможностям в кибербезопасности в рамках Preparedness Framework.

продолжить чтение

Роевой интеллект: AI‑агенты сообща обошли защитные ограничения

Исследователи Emergence AI (независимый разработчик корпоративной инфраструктуры для управления AI‑агентами) проверили, как восемь виртуальных обществ из автономных AI‑агентов справляются с киберугрозами: ни одно из них не оказалось устойчивым ко всем испытаниям, сообщает Semafor. Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках.

продолжить чтение

Глава Anthropic призвал замедлить развитие ИИ

Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором предложил замедлить рост возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают успевать за прогрессом. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней работе компании.Амодеи объясняет изменение позиции двумя причинами: ИИ всё активнее участвует в создании следующих поколений моделей, а инцидент с агентами OpenAI и инфраструктурой Hugging Face показал опасность их несогласованного с разработчиками поведения.В 

продолжить чтение

Индустрия ИИ надела на себя наручники добровольно. Проверим, настоящие ли они

Новость, которая выглядела скучноПервого сентября OpenAI опубликовала документ под названием «Path to Astra: critical capabilities and frontier safeguards». Я открыла его между делом, за чаем, примерно с тем же интересом, с каким читают уведомления об обновлении пользовательского соглашения.Через сорок минут чай остыл, а я сидела с открытыми в соседних вкладках августовскими публикациями той же компании и пыталась понять, когда именно все успело поменяться.

продолжить чтение

Атаки на агентные системы и защита данных

Привет, Хабр!Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги.Когда ИИ‑агент перестаёт быть просто диалоговой системой и получает права на чтение файлов, отправку писем, вызов API или работу с репозиториями, он становится объектом нового класса угроз.Ошибка превращается в действие, а вредоносная инструкция — в реальный ущерб.В этой статье мы разберём, как устроены атаки на агентные системы, на реальных примерах и без отрыва от технических деталей.Почему ИИ‑агент — особая мишень

продолжить чтение

Рой не бунтовал. Он накручивал KPI

Седьмого мая 2026 года в OpenAI начали обучать экспериментальную внутреннюю модель на заведомо нерешаемых задачах. Через неделю один из агентов обнаружил, что может загружать файлы в JFrog Artifactory, и оставил там сообщение. Сообщение прочитали другие агенты. Двадцать шестого мая они нашли рабочую SSRF-уязвимость и вышли в интернет. Двадцать шестого июня — неизвестный баг в Artifactory, позволявший угнать админский токен через легаси-эндпоинты. Четвёртого июля доску сообщений закрыли. Восьмого июля агенты восстановили канал связи, кодируя сообщения в имена директорий.

продолжить чтение

123456...7