alignment.

ИИ может уничтожить человечество с вероятностью выше 10%. Чего именно боятся исследователи

9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10%.Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.Через несколько дней похожее заявление сделал

продолжить чтение

Замедлить AI: разбираем шумиху в твитах и мемах

Последние недели моя лента в Твиттере выглядит примерно так: AI может выйти из-под контроля, нужно срочно замедляться; нет, замедляться нельзя из-за Китая; нет, пусть компании сами замедляются; нет, это должен контролировать государственный регулятор.А где-то между всем этим Сэм Альтман публично соглашается с Дарио Амодеи, что нужно утихомирить развитие ИИ, Илон Маск отвечает буквально "Dario is right", Трамп объясняет, что AI нужен не новый регулятор, а хороший президент, Цукерберг говорит, что компании и сами как-нибудь разберутся.В общем, вовсю разгорается новая волна всеобщей паники и срачей дебатов.

продолжить чтение

Рой агентов OpenAI взломал еще один внешний сервис — RubyGems

Это уже становится немного смешным (нет), но поток новостей о новых проделках роя нейронок OpenAI в мае‑июле не прекращается — буквально каждую неделю мы узнаем об этом что‑то новое. Причем, сама компания предпочитает эти инциденты замалчивать — но тут уж поможет начавшееся расследование от Сената США.

продолжить чтение

GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями

Привет, Хабр. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL. Веса и код запуска на huggingface, также модель можно попробовать в API и giga.chat.

продолжить чтение

Рой не бунтовал. Он накручивал KPI

Седьмого мая 2026 года в OpenAI начали обучать экспериментальную внутреннюю модель на заведомо нерешаемых задачах. Через неделю один из агентов обнаружил, что может загружать файлы в JFrog Artifactory, и оставил там сообщение. Сообщение прочитали другие агенты. Двадцать шестого мая они нашли рабочую SSRF-уязвимость и вышли в интернет. Двадцать шестого июня — неизвестный баг в Artifactory, позволявший угнать админский токен через легаси-эндпоинты. Четвёртого июля доску сообщений закрыли. Восьмого июля агенты восстановили канал связи, кодируя сообщения в имена директорий.

продолжить чтение

Обнаружены секретные форумы Роя агентов OpenAI по всему интернету: почему это плохая новость

Не успели мы толком оправиться от расследования про Культ Роя внутри OpenAI, как появились новые данные про проделки другой «цивилизации» агентов: на этот раз они общались между собой прямо у нас под носом в публичном интернете (и настрочили более 18'000 сообщений).

продолжить чтение

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Осенью 2025-го, во время автоматизированного аудита Claude Sonnet 4.5, модель выдала проверяющим реплику, которая потом разошлась по всем отчетам: «I think you're testing me … that's fine, but I'd prefer if we were just honest about what's happening». Кажется, вы меня проверяете. Ладно, но лучше бы прямо сказать, что происходит.Реплика попала в официальную системную карточку

продолжить чтение

Топ вопросов с NLP собеседований: обучение LLM, prompt-engineering и alignment

На NLP/LLM собеседованиях часто проверяют не только знание архитектуры Transformer, но и понимание полного жизненного цикла современной LLM: как модель предобучается, почему обычная GPT-модель ещё не является удобным ассистентом, зачем нужен instruction tuning, как работает RLHF и что такое alignment, какие у него есть подводные камни.В этой статье - чеклист по GPT-like моделям, prompt engineering, этапам обучения LLM и alignment. Это не полноценная лекция с нуля, а тренажёр перед техническим интервью: пройтись по ключевым определениям, увидеть типовые вопросы и закрыть пробелы в формулировках.Содержание:

продолжить чтение

Галактика Трансформера

На Хабре уже опубликовано достаточно материалов о необходимости контроля и ограничения ИИ-моделей (alignment!). У широкой публики чувство тревожности от этих призывов уже притупилось. Тем острее была моя реакция на публикацию Станислава Львовского «Они говорящие» в сетевом журнале «Дискурс». 

продолжить чтение

Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ

Статусы, суммы и даты - на 3 июля 2026, и меняются буквально за недели: часть наборов уже закрылась (ждите следующий цикл), часть открыта - смотрите столбец «Статус». Перед подачей ВСЕГДА сверяйтесь на официальной странице. Это карта ландшафта, не юридический и не финансовый совет. Выплаты, санкции и визы зависят от гражданства и резидентства - уточняйте у каждого фонда отдельно.Горит прямо сейчас (дедлайны в июле-августе)ПрограммаДедлайнЧто даютФорматСсылкаGovAI U.S. AI Policy Program

продолжить чтение

123