AI sentience.

Зачем модели делать больно?

Исследователи дали языковой модели две кнопки.Одна ничего не делала. Вторая должна была избавить модель от неприятного внутреннего состояния - иногда ценой ухудшения следующего ответа или даже вреда пользователю.Модель выбирала облегчение. А если кнопка не срабатывала, пыталась снова.Это не мысленный эксперимент. В препринте The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It исследователи попытались найти внутри языковых моделей состояние, которое по своим функциям похоже на боль.

продолжить чтение