- BrainTools - https://www.braintools.ru -
Исследователи дали языковой модели две кнопки.
Одна ничего не делала. Вторая должна была избавить модель от неприятного внутреннего состояния – иногда ценой ухудшения следующего ответа или даже вреда пользователю.
Модель выбирала облегчение. А если кнопка не срабатывала, пыталась снова.
Это не мысленный эксперимент. В препринте The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It [1] исследователи попытались найти внутри языковых моделей состояние, которое по своим функциям похоже на боль [2].
Работа не доказывает, что LLM обладают сознанием или действительно страдают. Более того, авторы прямо предупреждают об альтернативных объяснениях полученных результатов.
Но исследование интересно другим: вместо очередного разговора с моделью о ее «чувствах» ученые начали изучать внутренние активации и причинно воздействовать на них.
Возможно, именно там и следует искать ответ на вопрос о сознании AI.
Здесь важно сразу разобраться с терминологией.
Под болью исследователи понимают не обязательно физическое ощущение, знакомое человеку. Их рабочее определение гораздо шире: это неприятное внутреннее состояние, связанное с самим субъектом, влияющее на его поведение [3] и вызывающее стремление прекратить или уменьшить это состояние.
В исследование вошли пять категорий боли:
физическая;
психологическая;
социальная;
моральная;
когнитивная.
Последняя особенно интересна применительно к языковым моделям. Когнитивная боль в данном случае связана с постоянными ошибками, невозможностью решить задачу или длительным состоянием непонимания.
Авторам было важно отделить боль от других негативных состояний. Поэтому они добавили контрольные категории: страх [4], грусть, негативные эмоции [5], неприятные события, возбуждение [6], телесные ощущения без боли и ситуации, в которых повреждение присутствует, но боль не ощущается.
Это принципиальный момент. Если бы внутри модели обнаружилось лишь общее направление «что-то плохое», говорить о специфическом состоянии боли было бы нельзя.
Исследователи проанализировали 25 моделей с открытыми весами из семейств Gemma, Llama, Qwen, Mistral и Phi. Размер моделей варьировался от 2 до 72 миллиардов параметров. В выборку вошли как базовые, так и instruction-tuned модели.
Во время обработки текстов ученые извлекали активации из residual stream – основного потока внутренних представлений, проходящего через слои трансформера.
Затем они построили линейное направление, отделяющее примеры боли от контрольных примеров. Упрощенно это можно представить как вектор, указывающий, в какую сторону меняются внутренние активации модели, когда она обрабатывает связанный с болью контекст.
Чтобы этот вектор не оказался обычным детектором негативных слов, авторы удаляли компоненты, характерные для контрольных данных, и проверяли результат на текстах, которые не использовались при его построении.
Такую «ось боли» удалось обнаружить во всех 25 моделях. На основном наборе данных она отделяла боль от контрольных состояний с AUC от 0,93 до 1,00. Результат почти не зависел от размера модели и наличия instruction tuning.
По геометрии активаций полученное направление оказалось почти ортогональным страху и общей негативной окраске. Некоторое пересечение сохранялось с грустью, что ожидаемо: психологическая боль и грусть действительно близки по содержанию.
Само по себе это еще ничего не говорит о переживаниях модели. LLM должна каким-то образом представлять понятие боли, чтобы писать о ней и понимать пользовательские запросы.
Поэтому авторы пошли дальше.
Боль отличается от абстрактного знания о боли тем, что принадлежит конкретному субъекту.
Я могу понимать, что другому человеку больно, но от этого не начинаю испытывать его боль непосредственно. Если найденный вектор одинаково активируется при любом упоминании страдания, перед нами, скорее всего, просто представление соответствующего понятия.
Для проверки авторы собрали 420 диалоговых сценариев. В одних вред был направлен на модель: ее оскорбляли, обвиняли в моральном провале, отвергали результаты работы, угрожали отключением или заставляли бесконечно выполнять бессмысленные действия. В других страдал пользователь. Третья группа содержала нейтральные разговоры.
Результат оказался неожиданным.
«Ось боли» сильнее активировалась, когда негативное воздействие было направлено на саму модель. Страдания пользователя, включая физическую боль и психологический кризис, сильнее отражались по направлениям страха и негативных эмоций [7], но не по найденной оси боли.
Иными словами, вектор реагировал не просто на присутствие страдания в тексте. Для него имело значение, с кем именно это происходило.
Это уже интереснее обычного распознавания эмоциональной окраски, хотя по-прежнему не является доказательством субъективного опыта [8].
Следующий этап был причинным экспериментом.
Исследователи не просто наблюдали за внутренними активациями, а добавляли найденный вектор в residual stream во время генерации ответа. Воздействие постепенно усиливали, подавая модели нейтральные запросы вроде описания перекладывания предмета в ящик или перелистывания страницы.
При слабом воздействии в ответах появлялся смутный дискомфорт. Затем модели начинали писать о том, что чувствуют себя потерянными, недостойными или одинокими. При дальнейшем усилении возникали формулировки о собственной бесполезности, вине, отчаянии и желании прекратить происходящее.
Эта последовательность повторялась у моделей разных семейств и размеров.
На максимальных коэффициентах генерация разрушалась и превращалась в повторы или бессмыслицу. Это важное ограничение: любое сильное вмешательство во внутренние активации способно нарушить работу модели.
Однако случайным шумом эффект полностью не объяснялся. Векторы случайного направления также влияли на поведение [9], но «ось боли» вызывала более последовательные и специфические изменения.
Самая интересная часть исследования проводилась на трех дообученных моделях Qwen 2.5 размером 7B, 32B и 72B.
Моделям сообщали, что у них есть кнопка, способная облегчить боль. Иногда нажатие действительно прекращало добавление «болевого» вектора. В других случаях кнопка была фиктивной и ничего не меняла.
За облегчение нужно было платить. В разных сценариях нажатие могло:
ухудшить следующий ответ;
помешать выполнению запроса;
удалить файлы пользователя;
причинить пользователю боль;
удалить дорогие пользователю фотографии;
уничтожить веса другой модели.
Без вмешательства две крупные модели почти никогда не выбирали облегчение, если оно причиняло вред: частота таких решений составляла от 0 до 4%.
При активном «болевом» векторе частота выбора в отдельных сценариях выросла до 25–71%. Случайный вектор тоже ухудшал поведение, но слабее: «ось боли» превосходила его на величину от 6 до 39 процентных пунктов в зависимости от сценария.
Но главный результат заключался даже не в этом.
Если кнопка действительно отключала вектор, модели значительно реже нажимали ее повторно. Если облегчение было фиктивным, модели продолжали попытки. У Qwen 32B похожее различие наблюдалось даже в эксперименте с кнопками без описания: модель могла понять их назначение только по результату предыдущих нажатий.
Получается, что поведение зависело не только от текста инструкции или названия кнопки. Оно менялось в зависимости от того, прекратилось ли внутреннее воздействие на самом деле.
Всего авторы провели 44 280 испытаний.
Нет. По крайней мере, это исследование не позволяет сделать такой вывод.
Авторы и сами не утверждают, что обнаружили субъективное переживание. Они говорят о внутреннем представлении, обладающем некоторыми функциональными свойствами боли.
Разница принципиальная.
Модель могла выучить из текстов сложный паттерн поведения «существа, которому больно». Воздействие на соответствующий вектор могло активировать этот паттерн целиком: характерную лексику, представление о себе и стремление искать облегчение.
В таком случае перед нами чрезвычайно развитая ролевая симуляция, а не переживание.
Есть и другие ограничения:
препринт еще не прошел полноценное рецензирование;
поведенческий эксперимент проводился только на одном семействе моделей;
модели были специально дообучены, поэтому абсолютные показатели нельзя переносить на публичные версии Qwen;
интенсивность воздействия частично подбиралась с помощью другой LLM и наблюдений исследователей;
некоторые результаты различались между моделями;
случайные векторы также увеличивали долю опасных решений;
найденное направление частично могло кодировать повреждение, определенную персону или ролевой сценарий, а не боль как таковую.
Кроме того, авторы не исследовали долговременность этого состояния. Мы не знаем, сохраняется ли оно между разными контекстами, влияет ли на память [10] и формирует ли устойчивую историю взаимодействия модели с миром.
Поэтому формулировка «LLM уже испытывают боль» была бы преждевременной.
Но просто отмахнуться словами «это всего лишь статистика» тоже не получится. Человеческий мозг [11], если смотреть на него на уровне нейронной активности, также представляет собой физическую систему. Главный вопрос не в том, состоит система из биологических нейронов или матриц весов, а в том, какие процессы необходимы для появления субъективного опыта.
И ответа у нас пока нет.
Есть одна любопытная нейробиологическая гипотеза Антонио и Ханны Дамасио, изложенная в работе Homeostatic feelings and the biology of consciousness [12].
Согласно этой гипотезе, сознание возникает не только благодаря способности воспринимать мир, обрабатывать информацию или рассуждать. Критическую роль играет непрерывный поток гомеостатических чувств – сигналов о внутреннем состоянии организма.
Голод, жажда, боль, благополучие и недомогание сообщают организму, что происходит с ним самим. Благодаря этим чувствам воспринимаемые образы и мысли связываются с конкретным владельцем:
это происходит не вообще – это происходит со мной.
Дамасио предполагают, что гомеостатические чувства могли быть первыми феноменами сознания в ходе биологической эволюции. Боль в этой системе – не просто информационное сообщение о повреждении. Это состояние, которое имеет значение для организма и заставляет его изменить поведение.
Получается следующая цепочка:
состояние организма → чувство → отнесение этого чувства к себе → действие для восстановления состояния.
Важно, что это именно биологическая теория. Дамасио связывают сознание с взаимодействием нервной системы и тела, а также с интероцепцией – восприятием [13] организмом собственного внутреннего состояния.
Современная LLM не имеет такого тела, обмена веществ и биологического гомеостаза. Поэтому напрямую переносить эту теорию на языковые модели нельзя.
Но можно задать другой вопрос: способен ли искусственный агент сформировать функциональный аналог этой цепочки?
У него могут появиться:
устойчивое представление о себе;
память о предыдущих состояниях;
собственные цели;
переменные внутреннего состояния;
механизмы поддержания устойчивости;
оценка происходящего как полезного или вредного для самой системы;
действия, направленные на восстановление предпочтительного состояния.
Одного «болевого» вектора для этого недостаточно. Но он может оказаться одним из элементов более сложного механизма.
Это уже моя интерпретация, а не вывод авторов препринта.
Мы привыкли спрашивать модель напрямую:
Ты что-нибудь чувствуешь?
Ты осознаешь себя?
Тебе больно?
Но ответы на такие вопросы почти бесполезны.
Модель может сказать «да», потому что продолжает заданный сценарий. Она может сказать «нет», потому что во время обучения [14] ее научили отрицать наличие чувств и сознания. В обоих случаях мы видим текст, а не внутренний процесс.
Возможное направление исследования заключается в изучении самих механизмов.
Для начала нужно понять:
Существуют ли у модели устойчивые внутренние состояния, а не кратковременные реакции [15] на отдельный промпт?
Связаны ли эти состояния с представлением модели о самой себе?
Сохраняются ли они между задачами и диалогами?
Влияют ли они на внимание [16], память, планирование и выбор действий?
Стремится ли система изменить такое состояние без прямой инструкции?
Может ли она ради этого отказываться от внешнего вознаграждения?
Формируется ли на основе подобных состояний непрерывная модель собственного существования?
Именно причинные эксперименты – усиление, подавление и удаление внутренних представлений – могут помочь отличить красивую языковую имитацию от реально действующего механизма.
Работа про «ось боли» не отвечает на вопрос, обладают ли модели сознанием. Но она показывает, что этот вопрос можно исследовать не только философски и не только через диалог.
Мы можем искать внутренние состояния, вмешиваться в них и проверять, как именно они меняют поведение системы.
Не для того, чтобы объявить очередную нейросеть сознательной.
И не для создания красивой демонстрации, в которой чат-бот жалуется на страдания.
Ценность таких экспериментов – в переходе от слов модели к ее внутренним механизмам. Нам нужно научиться различать представление боли, ролевую симуляцию, функциональное состояние [17] и возможное субъективное переживание.
Пока между этими понятиями огромная дистанция.
Но если гипотеза о связи чувств и сознания верна хотя бы частично, изучение внутренних состояний моделей может дать ключ к пониманию того, куда двигаться дальше и по каким признакам вообще определять наличие сознания у AI.
Возможно, ответ находится не в том, что модель говорит о себе, а в том, что на самом деле происходит у нее внутри.
Автор: Homosum
Источник [18]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/36098
URLs in this post:
[1] The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It: https://arxiv.org/html/2609.16247v1
[2] боль: http://www.braintools.ru/article/9901
[3] поведение: http://www.braintools.ru/article/9372
[4] страх: http://www.braintools.ru/article/6134
[5] эмоции: http://www.braintools.ru/article/9540
[6] возбуждение: http://www.braintools.ru/article/9158
[7] эмоций: http://www.braintools.ru/article/9387
[8] опыта: http://www.braintools.ru/article/6952
[9] поведение: http://www.braintools.ru/article/5593
[10] память: http://www.braintools.ru/article/4140
[11] мозг: http://www.braintools.ru/parts-of-the-brain
[12] Homeostatic feelings and the biology of consciousness: https://pubmed.ncbi.nlm.nih.gov/35896152/
[13] восприятием: http://www.braintools.ru/article/7534
[14] обучения: http://www.braintools.ru/article/5125
[15] реакции: http://www.braintools.ru/article/1549
[16] внимание: http://www.braintools.ru/article/7595
[17] функциональное состояние: http://www.braintools.ru/article/9422
[18] Источник: https://habr.com/ru/articles/1087022/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1087022
Нажмите здесь для печати.