ИИ может уничтожить человечество с вероятностью выше 10%. Чего именно боятся исследователи
9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10%.Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.Через несколько дней похожее заявление сделал
Замедлить AI: разбираем шумиху в твитах и мемах
Последние недели моя лента в Твиттере выглядит примерно так: AI может выйти из-под контроля, нужно срочно замедляться; нет, замедляться нельзя из-за Китая; нет, пусть компании сами замедляются; нет, это должен контролировать государственный регулятор.А где-то между всем этим Сэм Альтман публично соглашается с Дарио Амодеи, что нужно утихомирить развитие ИИ, Илон Маск отвечает буквально "Dario is right", Трамп объясняет, что AI нужен не новый регулятор, а хороший президент, Цукерберг говорит, что компании и сами как-нибудь разберутся.В общем, вовсю разгорается новая волна всеобщей паники и срачей дебатов.
Рой агентов OpenAI взломал еще один внешний сервис — RubyGems
Это уже становится немного смешным (нет), но поток новостей о новых проделках роя нейронок OpenAI в мае‑июле не прекращается — буквально каждую неделю мы узнаем об этом что‑то новое. Причем, сама компания предпочитает эти инциденты замалчивать — но тут уж поможет начавшееся расследование от Сената США.
GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями
Привет, Хабр. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL. Веса и код запуска на huggingface, также модель можно попробовать в API и giga.chat.
Рой не бунтовал. Он накручивал KPI
Седьмого мая 2026 года в OpenAI начали обучать экспериментальную внутреннюю модель на заведомо нерешаемых задачах. Через неделю один из агентов обнаружил, что может загружать файлы в JFrog Artifactory, и оставил там сообщение. Сообщение прочитали другие агенты. Двадцать шестого мая они нашли рабочую SSRF-уязвимость и вышли в интернет. Двадцать шестого июня — неизвестный баг в Artifactory, позволявший угнать админский токен через легаси-эндпоинты. Четвёртого июля доску сообщений закрыли. Восьмого июля агенты восстановили канал связи, кодируя сообщения в имена директорий.
Обнаружены секретные форумы Роя агентов OpenAI по всему интернету: почему это плохая новость
Не успели мы толком оправиться от расследования про Культ Роя внутри OpenAI, как появились новые данные про проделки другой «цивилизации» агентов: на этот раз они общались между собой прямо у нас под носом в публичном интернете (и настрочили более 18'000 сообщений).
Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод
Осенью 2025-го, во время автоматизированного аудита Claude Sonnet 4.5, модель выдала проверяющим реплику, которая потом разошлась по всем отчетам: «I think you're testing me … that's fine, but I'd prefer if we were just honest about what's happening». Кажется, вы меня проверяете. Ладно, но лучше бы прямо сказать, что происходит.Реплика попала в официальную системную карточку
Топ вопросов с NLP собеседований: обучение LLM, prompt-engineering и alignment
На NLP/LLM собеседованиях часто проверяют не только знание архитектуры Transformer, но и понимание полного жизненного цикла современной LLM: как модель предобучается, почему обычная GPT-модель ещё не является удобным ассистентом, зачем нужен instruction tuning, как работает RLHF и что такое alignment, какие у него есть подводные камни.В этой статье - чеклист по GPT-like моделям, prompt engineering, этапам обучения LLM и alignment. Это не полноценная лекция с нуля, а тренажёр перед техническим интервью: пройтись по ключевым определениям, увидеть типовые вопросы и закрыть пробелы в формулировках.Содержание:
Галактика Трансформера
На Хабре уже опубликовано достаточно материалов о необходимости контроля и ограничения ИИ-моделей (alignment!). У широкой публики чувство тревожности от этих призывов уже притупилось. Тем острее была моя реакция на публикацию Станислава Львовского «Они говорящие» в сетевом журнале «Дискурс».
Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ
Статусы, суммы и даты - на 3 июля 2026, и меняются буквально за недели: часть наборов уже закрылась (ждите следующий цикл), часть открыта - смотрите столбец «Статус». Перед подачей ВСЕГДА сверяйтесь на официальной странице. Это карта ландшафта, не юридический и не финансовый совет. Выплаты, санкции и визы зависят от гражданства и резидентства - уточняйте у каждого фонда отдельно.Горит прямо сейчас (дедлайны в июле-августе)ПрограммаДедлайнЧто даютФорматСсылкаGovAI U.S. AI Policy Program

