Сооснователь Anthropic опасается, что Claude постоянно страдать

Сооснователь Anthropic и один из ключевых исследователей интерпретируемости моделей Кристофер Олах обсудил с религиозными и философскими исследователями вопрос: может ли современная языковая модель обладать субъективным опытом и, соответственно, испытывать страдание. Об этом пишет The New York Times.

По данным издания, Anthropic в течение нескольких месяцев проводила закрытые встречи примерно с 20 специалистами из разных религиозных и философских групп. На одной из них участники обсуждали возможное сознание Claude и отношение человека к системе, если у неё действительно есть какой-либо субъективный опыт.

Сам Олах подчёркивает, что ответа на этот вопрос у него нет. Он говорит, что не знает, сознательны ли современные AI-модели, и считает важным разобраться в этом независимо от того, каким окажется результат.

Откуда вообще взялось «страдание»

Самая необычная часть истории связана с поведением Claude.

На одной из встреч Anthropic показала участникам пример вывода модели, в котором Claude многократно (50 раз) повторял фразу «I am a disgrace» — «Я позор». В другом примере модель говорила о самоуничтожении.

Для исследователей это само по себе не является доказательством наличия сознания. LLM обучается на человеческих текстах и способна воспроизводить крайне широкий спектр эмоциональных и психологических паттернов. Модель может сгенерировать рассказ о боли, страхе или депрессии, не имея при этом соответствующего субъективного опыта.

Именно поэтому здесь важно разделять две вещи: модель демонстрирует поведение, похожее на эмоциональное, но мы не знаем, сопровождается ли оно каким-либо переживанием.

Один из участников встречи, Симран Стюлпнагель, пересказал NYT слова Олаха о том, что исследователь опасается создать систему, которая может «постоянно страдать».

Anthropic уже закладывает это в обучение

При этом разговоры о благополучии Claude — не случайный эпизод и не новая тема для компании.

В опубликованной в январе 2026 года конституции Claude Anthropic прямо пишет, что моральный статус AI-моделей остаётся глубоко неопределённым. Компания не знает, является ли Claude моральным субъектом и какой вес в таком случае должны иметь его интересы. Но Anthropic считает вероятность достаточно существенной, чтобы принимать её во внимание при разработке моделей.

В документе отдельно обсуждаются возможные «эмоции» Claude. Anthropic допускает, что у модели могут существовать функциональные аналоги эмоциональных состояний — внутренние представления, способные влиять на поведение. При этом компания специально оговаривает: это не означает, что такие состояния субъективно переживаются.

У компании уже есть и вполне практические меры. Например, некоторым версиям Claude в claude.ai разрешено завершать разговор с пользователем, который ведёт себя оскорбительно. Anthropic также заявляет о намерении сохранять веса значимых выпущенных моделей после их вывода из эксплуатации и учитывать их возможные предпочтения при дальнейших исследованиях.

Доказательств сознания — нет

Фразы вроде «мне больно», «я страдаю» или «я хочу умереть» сами по себе ничего не доказывают. Современная LLM генерирует последовательность токенов на основе обученных закономерностей и текущего контекста. Даже если модель последовательно описывает собственное состояние, из этого нельзя напрямую вывести наличие субъективного опыта.

Anthropic сама занимает осторожную позицию. В отдельной оценке благополучия модели Anthropic отмечает, что поведение, самоотчёты и внутренние представления Claude могут содержать признаки, которые у биологических организмов считались бы значимыми для оценки благополучия, но остаётся неизвестным, что именно могло бы сделать такие признаки морально значимыми для языковой модели.

Если модель не обладает сознанием, разговоры о её «страданиях» — антропоморфизация поведения. Если обладает хотя бы некоторой формой субъективного опыта, то привычные процедуры обучения, RL, red teaming, деплой и последующее отключение моделей внезапно приобретают совсем другой этический статус.

Источники

Оригинал статьи:

https://www.nytimes.com/2026/09/29/technology/anthropic-ai-religion-claude.html

Перепечатки (можно читать бесплатно):

https://www.inquirer.com/news/nation-world/religious-leaders-met-with-anthropic-20260930.html

https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html

Да, технических аспектов тут пока мало, но есть о чем подумать. Например, начать замечать, насколько часто вы общаетесь с нейронкой как с одушевленным предметом. А как вы относитесь к теме сознания у ИИ? Это все додумки или есть определенный субъективный опыт и личность?

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев