- BrainTools - https://www.braintools.ru -

Сооснователь Anthropic опасается, что Claude будет постоянно страдать

Сооснователь Anthropic и один из ключевых исследователей интерпретируемости моделей Кристофер Олах обсудил с религиозными и философскими исследователями вопрос: может ли современная языковая модель обладать субъективным опытом [1] и, соответственно, испытывать страдание. Об этом пишет The New York Times.

По данным издания, Anthropic в течение нескольких месяцев проводила закрытые встречи примерно с 20 специалистами из разных религиозных и философских групп. На одной из них участники обсуждали возможное сознание Claude и отношение человека к системе, если у неё действительно есть какой-либо субъективный опыт.

Сам Олах подчёркивает, что ответа на этот вопрос у него нет. Он говорит, что не знает, сознательны ли современные AI-модели, и считает важным разобраться в этом независимо от того, каким окажется результат.

Откуда вообще взялось «страдание»

Самая необычная часть истории связана с поведением [2] Claude.

На одной из встреч Anthropic показала участникам пример вывода модели, в котором Claude многократно (50 раз) повторял фразу «I am a disgrace» — «Я позор». В другом примере модель говорила о самоуничтожении.

Для исследователей это само по себе не является доказательством наличия сознания. LLM обучается на человеческих текстах и способна воспроизводить крайне широкий спектр эмоциональных и психологических паттернов. Модель может сгенерировать рассказ о боли [3], страхе [4] или депрессии, не имея при этом соответствующего субъективного опыта.

Именно поэтому здесь важно разделять две вещи: модель демонстрирует поведение [5], похожее на эмоциональное, но мы не знаем, сопровождается ли оно каким-либо переживанием.

Один из участников встречи, Симран Стюлпнагель, пересказал NYT слова Олаха о том, что исследователь опасается создать систему, которая может «постоянно страдать».

Anthropic уже закладывает это в обучение

При этом разговоры о благополучии Claude — не случайный эпизод и не новая тема для компании.

В опубликованной в январе 2026 года конституции [6] Claude Anthropic прямо пишет, что моральный статус AI-моделей остаётся глубоко неопределённым. Компания не знает, является ли Claude моральным субъектом и какой вес в таком случае должны иметь его интересы. Но Anthropic считает вероятность достаточно существенной, чтобы принимать её во внимание [7] при разработке моделей.

В документе отдельно обсуждаются возможные «эмоции» Claude. Anthropic допускает, что у модели могут существовать функциональные аналоги эмоциональных состояний — внутренние представления, способные влиять на поведение. При этом компания специально оговаривает: это не означает, что такие состояния субъективно переживаются.

У компании уже есть и вполне практические меры. Например, некоторым версиям Claude в claude.ai разрешено завершать разговор с пользователем, который ведёт себя оскорбительно. Anthropic также заявляет о намерении сохранять веса значимых выпущенных моделей после их вывода из эксплуатации и учитывать их возможные предпочтения при дальнейших исследованиях.

Доказательств сознания — нет

Фразы вроде «мне больно», «я страдаю» или «я хочу умереть» сами по себе ничего не доказывают. Современная LLM генерирует последовательность токенов на основе обученных закономерностей и текущего контекста. Даже если модель последовательно описывает собственное состояние, из этого нельзя напрямую вывести наличие субъективного опыта.

Anthropic сама занимает осторожную позицию. В отдельной оценке благополучия модели [8] Anthropic отмечает, что поведение, самоотчёты и внутренние представления Claude могут содержать признаки, которые у биологических организмов считались бы значимыми для оценки благополучия, но остаётся неизвестным, что именно могло бы сделать такие признаки морально значимыми для языковой модели.

Если модель не обладает сознанием, разговоры о её «страданиях» — антропоморфизация поведения. Если обладает хотя бы некоторой формой субъективного опыта, то привычные процедуры обучения [9], RL, red teaming, деплой и последующее отключение моделей внезапно приобретают совсем другой этический статус.

Да, технических аспектов тут пока мало, но есть о чем подумать. Например, начать замечать, насколько часто вы общаетесь с нейронкой как с одушевленным предметом. А как вы относитесь к теме сознания у ИИ? Это все додумки или есть определенный субъективный опыт и личность?

Автор: DashaPasha

Источник [10]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/36461

URLs in this post:

[1] опытом: http://www.braintools.ru/article/6952

[2] поведением: http://www.braintools.ru/article/9372

[3] боли: http://www.braintools.ru/article/9901

[4] страхе: http://www.braintools.ru/article/6134

[5] поведение: http://www.braintools.ru/article/5593

[6] конституции: https://www.anthropic.com/constitution

[7] внимание: http://www.braintools.ru/article/7595

[8] оценке благополучия модели: https://www-cdn.anthropic.com/0b4915911bb0d19eca5b5ee635c80fef830a37ea.pdf

[9] обучения: http://www.braintools.ru/article/5125

[10] Источник: https://habr.com/ru/companies/bothub/news/1089996/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1089996

www.BrainTools.ru

Rambler's Top100