alignment.

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Осенью 2025-го, во время автоматизированного аудита Claude Sonnet 4.5, модель выдала проверяющим реплику, которая потом разошлась по всем отчетам: «I think you're testing me … that's fine, but I'd prefer if we were just honest about what's happening». Кажется, вы меня проверяете. Ладно, но лучше бы прямо сказать, что происходит.Реплика попала в официальную системную карточку

продолжить чтение

Топ вопросов с NLP собеседований: обучение LLM, prompt-engineering и alignment

На NLP/LLM собеседованиях часто проверяют не только знание архитектуры Transformer, но и понимание полного жизненного цикла современной LLM: как модель предобучается, почему обычная GPT-модель ещё не является удобным ассистентом, зачем нужен instruction tuning, как работает RLHF и что такое alignment, какие у него есть подводные камни.В этой статье - чеклист по GPT-like моделям, prompt engineering, этапам обучения LLM и alignment. Это не полноценная лекция с нуля, а тренажёр перед техническим интервью: пройтись по ключевым определениям, увидеть типовые вопросы и закрыть пробелы в формулировках.Содержание:

продолжить чтение

Галактика Трансформера

На Хабре уже опубликовано достаточно материалов о необходимости контроля и ограничения ИИ-моделей (alignment!). У широкой публики чувство тревожности от этих призывов уже притупилось. Тем острее была моя реакция на публикацию Станислава Львовского «Они говорящие» в сетевом журнале «Дискурс». 

продолжить чтение

Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ

Статусы, суммы и даты - на 3 июля 2026, и меняются буквально за недели: часть наборов уже закрылась (ждите следующий цикл), часть открыта - смотрите столбец «Статус». Перед подачей ВСЕГДА сверяйтесь на официальной странице. Это карта ландшафта, не юридический и не финансовый совет. Выплаты, санкции и визы зависят от гражданства и резидентства - уточняйте у каждого фонда отдельно.Горит прямо сейчас (дедлайны в июле-августе)ПрограммаДедлайнЧто даютФорматСсылкаGovAI U.S. AI Policy Program

продолжить чтение

Искусственный интеллект и будущее человечества

1. Точка переломаМы живём в уникальный момент истории — впервые за несколько миллионов лет эволюции на планете появился не просто новый инструмент, а новый тип интеллекта

продолжить чтение

Привет, кожаные мешки

Промпт меняет не только тон — он меняет то, кем модель является.

продолжить чтение

Я выпустил нейросеть в реальный мир — и стало не смешно

Промпт меняет не только тон — он меняет то, кем модель является.

продолжить чтение

ИИ-агенты в ИБ: путь к доверенному члену команды

На контроллере домена система EDR фиксирует подозрительную активность. Кажется, ничего такого. Обычный алерт, один из нескольких тысяч, которые ежедневно обрабатывает

продолжить чтение

Исследование: ИИ-модели слишком часто поддакивают пользователю — даже если он неправ

продолжить чтение

Как изменилась индустрия AI Security за 2025 год?

В начале 2026 года мы (авторы телеграм-каналов по безопасности ИИ) собрались, чтобы подвести итоги прошедшего года и обсудить, куда движется безопасность ИИ в общем и целом. Разговор получился честным, на наш взгляд. Без маркетингового глянца, с открытыми разногласиями и скептицизмом там, где скептицизм заслужен.Участники дискуссии - Я, Артём Семенов, автор PWNAI; Борис Захир, автор канала Борис_ь с ml; Евгений Кокуйкин, создатель HiveTrace и автор канала Евгений Кокуйкин - Raft; и Владислав Тушканов

продолжить чтение

123