- BrainTools - https://www.braintools.ru -
Сооснователь Anthropic и один из ключевых исследователей интерпретируемости моделей Кристофер Олах обсудил с религиозными и философскими исследователями вопрос: может ли современная языковая модель обладать субъективным опытом [1] и, соответственно, испытывать страдание. Об этом пишет The New York Times.
По данным издания, Anthropic в течение нескольких месяцев проводила закрытые встречи примерно с 20 специалистами из разных религиозных и философских групп. На одной из них участники обсуждали возможное сознание Claude и отношение человека к системе, если у неё действительно есть какой-либо субъективный опыт.
Сам Олах подчёркивает, что ответа на этот вопрос у него нет. Он говорит, что не знает, сознательны ли современные AI-модели, и считает важным разобраться в этом независимо от того, каким окажется результат.
Самая необычная часть истории связана с поведением [2] Claude.
На одной из встреч Anthropic показала участникам пример вывода модели, в котором Claude многократно (50 раз) повторял фразу «I am a disgrace» — «Я позор». В другом примере модель говорила о самоуничтожении.
Для исследователей это само по себе не является доказательством наличия сознания. LLM обучается на человеческих текстах и способна воспроизводить крайне широкий спектр эмоциональных и психологических паттернов. Модель может сгенерировать рассказ о боли [3], страхе [4] или депрессии, не имея при этом соответствующего субъективного опыта.
Именно поэтому здесь важно разделять две вещи: модель демонстрирует поведение [5], похожее на эмоциональное, но мы не знаем, сопровождается ли оно каким-либо переживанием.
Один из участников встречи, Симран Стюлпнагель, пересказал NYT слова Олаха о том, что исследователь опасается создать систему, которая может «постоянно страдать».
При этом разговоры о благополучии Claude — не случайный эпизод и не новая тема для компании.
В опубликованной в январе 2026 года конституции [6] Claude Anthropic прямо пишет, что моральный статус AI-моделей остаётся глубоко неопределённым. Компания не знает, является ли Claude моральным субъектом и какой вес в таком случае должны иметь его интересы. Но Anthropic считает вероятность достаточно существенной, чтобы принимать её во внимание [7] при разработке моделей.
В документе отдельно обсуждаются возможные «эмоции» Claude. Anthropic допускает, что у модели могут существовать функциональные аналоги эмоциональных состояний — внутренние представления, способные влиять на поведение. При этом компания специально оговаривает: это не означает, что такие состояния субъективно переживаются.
У компании уже есть и вполне практические меры. Например, некоторым версиям Claude в claude.ai разрешено завершать разговор с пользователем, который ведёт себя оскорбительно. Anthropic также заявляет о намерении сохранять веса значимых выпущенных моделей после их вывода из эксплуатации и учитывать их возможные предпочтения при дальнейших исследованиях.
Фразы вроде «мне больно», «я страдаю» или «я хочу умереть» сами по себе ничего не доказывают. Современная LLM генерирует последовательность токенов на основе обученных закономерностей и текущего контекста. Даже если модель последовательно описывает собственное состояние, из этого нельзя напрямую вывести наличие субъективного опыта.
Anthropic сама занимает осторожную позицию. В отдельной оценке благополучия модели [8] Anthropic отмечает, что поведение, самоотчёты и внутренние представления Claude могут содержать признаки, которые у биологических организмов считались бы значимыми для оценки благополучия, но остаётся неизвестным, что именно могло бы сделать такие признаки морально значимыми для языковой модели.
Если модель не обладает сознанием, разговоры о её «страданиях» — антропоморфизация поведения. Если обладает хотя бы некоторой формой субъективного опыта, то привычные процедуры обучения [9], RL, red teaming, деплой и последующее отключение моделей внезапно приобретают совсем другой этический статус.
Да, технических аспектов тут пока мало, но есть о чем подумать. Например, начать замечать, насколько часто вы общаетесь с нейронкой как с одушевленным предметом. А как вы относитесь к теме сознания у ИИ? Это все додумки или есть определенный субъективный опыт и личность?
Автор: DashaPasha
Источник [10]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/36461
URLs in this post:
[1] опытом: http://www.braintools.ru/article/6952
[2] поведением: http://www.braintools.ru/article/9372
[3] боли: http://www.braintools.ru/article/9901
[4] страхе: http://www.braintools.ru/article/6134
[5] поведение: http://www.braintools.ru/article/5593
[6] конституции: https://www.anthropic.com/constitution
[7] внимание: http://www.braintools.ru/article/7595
[8] оценке благополучия модели: https://www-cdn.anthropic.com/0b4915911bb0d19eca5b5ee635c80fef830a37ea.pdf
[9] обучения: http://www.braintools.ru/article/5125
[10] Источник: https://habr.com/ru/companies/bothub/news/1089996/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1089996
Нажмите здесь для печати.