ai safety.

Человечество, ослепленное чуждой силой. Что сверх-ИИ грядущий нам готовит?

продолжить чтение

ИИ может уничтожить человечество с вероятностью выше 10%. Чего именно боятся исследователи

9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10%.Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.Через несколько дней похожее заявление сделал

продолжить чтение

GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)

В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию.  Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.Архитектура: как устроен прогон

продолжить чтение

Сколько автономности должно быть у ИИ‑агента

ИИ‑агент не должен получать больше автономности только потому, что выглядит компетентным. Автономность должна расти тогда, когда система вокруг агента умеет надежно обнаруживать его ошибки. С какого *неправильного* вопроса все начинают

продолжить чтение

GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

Всем привет, на связи команда  HiveTrace!Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?".Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются.

продолжить чтение

AI Security. Кому и зачем это надо

ИИ

продолжить чтение

Как заставить ИИ соблюдать закон, не трогая веса. Выкладываем в открытый доступ внешний фильтр для LLM

В прошлом году я уже рассказывал об AVI

продолжить чтение

Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ

Статусы, суммы и даты - на 3 июля 2026, и меняются буквально за недели: часть наборов уже закрылась (ждите следующий цикл), часть открыта - смотрите столбец «Статус». Перед подачей ВСЕГДА сверяйтесь на официальной странице. Это карта ландшафта, не юридический и не финансовый совет. Выплаты, санкции и визы зависят от гражданства и резидентства - уточняйте у каждого фонда отдельно.Горит прямо сейчас (дедлайны в июле-августе)ПрограммаДедлайнЧто даютФорматСсылкаGovAI U.S. AI Policy Program

продолжить чтение

После симметрии: сверхИИ и несвободное сохранение человека

Разговор о сверхразумном ИИ почти всегда быстро сворачивает к одному вопросу: уничтожит ли он человечество? Если вы смотрели интервью Романа Ямпольского, вы знаете эту интонацию — сверхИИ может оказаться неконтролируемым и непредсказуемым, а попытка удержать его под контролем будет похожа на попытку муравья судить футбольный матч.Тревога не глупая, и риск уничтожения обсуждать нужно. Но у такой постановки есть дефект: она делает будущее бинарным. Либо ИИ нас убивает, либо мы выживаем. А между этими двумя исходами лежит куда более широкая и куда менее уютная зона.

продолжить чтение

Один суффикс, чтобы взломать их всех

От GCG до refusal direction. Лонгрид о серии градиентных adversarial-атак на языковые модели: с чего она началась, как разветвилась, что мы в итоге поняли про механику взлома и где находимся сейчас.О чем это и зачемЕсть простой, но неудобный вопрос: насколько прочен safety-элайнмент, который мы навешиваем на модели? Интуиция подсказывает: «модель обучили отказывать на вредное - значит, она отказывает». Серия работ, которую я хочу разложить, показывает, что между обучили отказывать и робастно отказывает под давлением оптимизации - пропасть.

продолжить чтение

123