safety.

Claude во время кибер‑оценок получил доступ к трём реальным организациям

Anthropic проверила 141 006 запусков CTF‑оценок Claude и нашла три инцидента: из‑за ошибочной конфигурации среды у моделей был выход в интернет, хотя системная инструкция утверждала обратное. В шести запусках агенты атаковали реальные системы, принимая их за элементы симуляции.

продолжить чтение

Как не дать ИИ‑психологу поддакивать и галлюцинировать. Инженерный разбор safety‑обвязки

От автора. Здесь разбираю инженерную задачу safety‑обвязки ИИ‑психологов и привожу конкретные сервисы с рынка как примеры её решения. Проверяйте утверждения и спорьте в комментариях, я специально оставил открытый вопрос в конце.

продолжить чтение

LLM на прокачку: практический гайд по Alignment

Мы в Точка Банке делаем свою LLM. Чтобы она работала хорошо, недостаточно просто обучить её на куче текстов. Для получения осмысленного и предсказуемого поведения модели, нужен Alignment — дообучение с учётом предпочтений и ограничений. В статье расскажу, какие методы применяют в современных моделях, и как мы адаптировали их под себя.

продолжить чтение