Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод
Осенью 2025-го, во время автоматизированного аудита Claude Sonnet 4.5, модель выдала проверяющим реплику, которая потом разошлась по всем отчетам: «I think you're testing me … that's fine, but I'd prefer if we were just honest about what's happening». Кажется, вы меня проверяете. Ладно, но лучше бы прямо сказать, что происходит.Реплика попала в официальную системную карточку
Топ вопросов с NLP собеседований: обучение LLM, prompt-engineering и alignment
На NLP/LLM собеседованиях часто проверяют не только знание архитектуры Transformer, но и понимание полного жизненного цикла современной LLM: как модель предобучается, почему обычная GPT-модель ещё не является удобным ассистентом, зачем нужен instruction tuning, как работает RLHF и что такое alignment, какие у него есть подводные камни.В этой статье - чеклист по GPT-like моделям, prompt engineering, этапам обучения LLM и alignment. Это не полноценная лекция с нуля, а тренажёр перед техническим интервью: пройтись по ключевым определениям, увидеть типовые вопросы и закрыть пробелы в формулировках.Содержание:
Галактика Трансформера
На Хабре уже опубликовано достаточно материалов о необходимости контроля и ограничения ИИ-моделей (alignment!). У широкой публики чувство тревожности от этих призывов уже притупилось. Тем острее была моя реакция на публикацию Станислава Львовского «Они говорящие» в сетевом журнале «Дискурс».
Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ
Статусы, суммы и даты - на 3 июля 2026, и меняются буквально за недели: часть наборов уже закрылась (ждите следующий цикл), часть открыта - смотрите столбец «Статус». Перед подачей ВСЕГДА сверяйтесь на официальной странице. Это карта ландшафта, не юридический и не финансовый совет. Выплаты, санкции и визы зависят от гражданства и резидентства - уточняйте у каждого фонда отдельно.Горит прямо сейчас (дедлайны в июле-августе)ПрограммаДедлайнЧто даютФорматСсылкаGovAI U.S. AI Policy Program
Искусственный интеллект и будущее человечества
1. Точка переломаМы живём в уникальный момент истории — впервые за несколько миллионов лет эволюции на планете появился не просто новый инструмент, а новый тип интеллекта
Привет, кожаные мешки
Промпт меняет не только тон — он меняет то, кем модель является.
Я выпустил нейросеть в реальный мир — и стало не смешно
Промпт меняет не только тон — он меняет то, кем модель является.
ИИ-агенты в ИБ: путь к доверенному члену команды
На контроллере домена система EDR фиксирует подозрительную активность. Кажется, ничего такого. Обычный алерт, один из нескольких тысяч, которые ежедневно обрабатывает
Как изменилась индустрия AI Security за 2025 год?
В начале 2026 года мы (авторы телеграм-каналов по безопасности ИИ) собрались, чтобы подвести итоги прошедшего года и обсудить, куда движется безопасность ИИ в общем и целом. Разговор получился честным, на наш взгляд. Без маркетингового глянца, с открытыми разногласиями и скептицизмом там, где скептицизм заслужен.Участники дискуссии - Я, Артём Семенов, автор PWNAI; Борис Захир, автор канала Борис_ь с ml; Евгений Кокуйкин, создатель HiveTrace и автор канала Евгений Кокуйкин - Raft; и Владислав Тушканов

