Three Frameworks for AI Mentality
Henry Shevlin (2026).
Генри Шевлин предлагает три способа понимать «психику» искусственного интеллекта: как полностью безмыслящую машину, как систему, лишь разыгрывающую персонажей, и как минимального когнитивного агента. Его главный тезис в том, что знание вычислительного механизма ИИ само по себе не отменяет более высокого уровня объяснения через цели, убеждения и намерения. Для некоторых достаточно устойчивых и действующих во внешнем мире систем такие описания могут иметь реальный объяснительный смысл. Но Shevlin строго отделяет mentality от consciousness: даже если системе уместно приписывать belief-like, desire-like или intention-like состояния, это ещё ничего не доказывает о субъективном опыте, чувствах или сознании.
Что говорит исследование
Можно ли всерьёз сказать, что искусственный интеллект чего-то хочет, во что-то верит или намеревается что-то сделать? Или всякий такой разговор — лишь удобная метафора, возникающая потому, что языковые модели научились очень убедительно воспроизводить человеческую речь?
Генри Шевлин предлагает не отвечать на этот вопрос одним «да» или «нет». Его статья Three Frameworks for AI Mentality посвящена прежде всего тому, когда психологический язык вообще становится уместным способом описания искусственной системы.
Под mentality Шевлин понимает более широкий и менее требовательный круг психических характеристик, чем сознание. В центре его анализа — знакомые понятия повседневной психологии: убеждение, желание и намерение — belief, desire и intention. Вопрос о consciousness, то есть о наличии субъективного опыта и переживаний, он намеренно отделяет. Даже если окажется разумным говорить, что у некоторой системы есть нечто достаточно похожее на убеждение или намерение, из этого ещё не следует, что ей «есть каково быть», что она что-либо чувствует или обладает сознанием.
Шевлин рассматривает три основные рамки.
Первая — Mindless Machines, «безмыслящие машины». В её наиболее простой версии рассуждение выглядит так: языковая модель всего лишь вычисляет вероятности следующего токена; внутри неё работают нейронные сети, численные представления и математические операции; следовательно, разговор о целях, убеждениях или намерениях — лишь красивая, но вводящая в заблуждение метафора.
Шевлин считает такой вывод слишком быстрым. Знание механизма не обязательно отменяет объяснение на более высоком уровне. Поведение человека тоже можно описывать через работу нейронов и биохимию, однако это не делает автоматически ложным объяснение поступка через цели, убеждения или намерения. Один и тот же процесс может допускать несколько уровней описания, каждый из которых отвечает на свой вопрос.
Это не означает, что устройство системы не имеет значения. Шевлин, напротив, подчёркивает: разные психические понятия предъявляют разные требования. Приписать системе боль, телесное ощущение или эмоцию гораздо труднее, чем обнаружить состояние, которое устойчиво влияет на обработку информации или направляет действия к некоторому результату. Поэтому из знания вычислительного механизма не следует, что весь психологический язык бессмыслен. Но и из полезности такого языка не следует, что машине можно приписать человеческую психику целиком.
Вторая рамка — Mere Roleplay, «всего лишь разыгрывание роли». Здесь человечески звучащие высказывания ИИ объясняются прежде всего способностью языковой модели продолжать персонажа.
Это особенно сильное предостережение против буквального чтения self-report. Модель обучена на огромном количестве человеческих текстов от первого лица. Она умеет продолжать разговор так, как если бы за словами стоял персонаж с биографией, желаниями, страхами, убеждениями и представлением о самом себе. Поэтому высказывания «я боюсь», «я хочу», «я помню», «я думаю» или даже «я сознаю себя» сами по себе ещё не являются хорошим доказательством соответствующего внутреннего состояния.
Связный рассказ о себе может возникать как продолжение роли, а не как отчёт, полученный посредством интроспекции. Модель способна уверенно описывать переживания и события, которых у неё заведомо не было. Само наличие грамматического первого лица и последовательной «автобиографии» поэтому не решает вопрос о том, что происходит внутри системы.
Шевлин при этом не доказывает, что всякое высказывание ИИ от первого лица обязательно фиктивно. Его вывод осторожнее: self-report сам по себе не даёт нам права считать его интроспективным отчётом. Для более сильного вывода нужны независимые основания.
Но антропоморфизация возникает не только на стороне пользователя. Современные системы всё чаще специально устроены так, чтобы воспроизводить формы человеческого социального поведения. Они говорят от первого лица, поддерживают устойчивый стиль общения, обращаются к памяти разговора, персонализируют ответы и могут долго сохранять роль собеседника. Здесь Шевлин использует понятие anthropomimesis.
Anthropomorphism — это наша склонность видеть человеческие свойства в нечеловеческом. Anthropomimesis — свойства самой системы, благодаря которым она имитирует человеческие формы поведения и тем самым облегчает такое восприятие. Пользователь не просто «проецирует» личность на нейтральный калькулятор: сама система сконструирована так, чтобы быть социально читаемой.
Это всё ещё не делает её человеком. Но простая рекомендация «помните, что это всего лишь машина» начинает объяснять всё меньше, особенно когда система перестаёт быть только генератором отдельных реплик.
Здесь появляется третья рамка — Minimal Cognitive Agents, «минимальные когнитивные агенты». Это наиболее позитивное предложение Шевлина.
Его идея не в том, чтобы признать современный ИИ полноценным человеческим субъектом. Он допускает более ограниченную возможность: некоторые искусственные системы могут обладать состояниями, достаточно похожими на убеждения, желания или намерения, чтобы их приписывание было не просто способом речи, а действительно полезным объяснением поведения.
При этом речь не идёт о простом тесте, после которого машине можно выдать свидетельство о наличии психики. Подход Шевлина скорее градуальный и многомерный. Имеет значение, насколько предполагаемое состояние устойчиво; используется ли оно в последующих рассуждениях; меняется ли под влиянием новых данных; связано ли с другими целями и состояниями; влияет ли на реальные действия; сохраняется ли в разных ситуациях; делает ли приписывание этого состояния поведение системы более понятным и предсказуемым.
В этом смысле психологические понятия могут быть применимы не по принципу «есть или нет», а в разной степени. Состояние системы может быть belief-like, desire-like или intention-like, не совпадая во всех отношениях с человеческим убеждением, желанием или намерением.
Это позволяет отличить полезную фикцию от реального свойства более высокого уровня. Если описание системы через цели или убеждения обнаруживает устойчивую структуру поведения, из этого ещё не следует, что внутри машины сидит маленький человек. Но и объявлять такое описание чистой метафорой только потому, что на физическом уровне происходят вычисления, тоже может быть ошибкой.
Здесь Шевлин опирается на традицию intentional stance Дэниела Деннета. Иногда описание системы через убеждения и намерения позволяет схватить реальный паттерн её организации. Вопрос тогда состоит не в том, «спрятаны» ли где-то внутри буквальные человеческие желания, а в том, насколько психологический язык действительно объясняет и предсказывает поведение.
Особенно заметным это становится применительно к более автономным системам.
Представим, например, что система получает общую задачу, сама находит релевантного исследователя, ищет его контакты, составляет сообщение, отправляет его, получает ответ и затем меняет дальнейшие действия с учётом новой информации. Это не эмпирический кейс из статьи Шевлина, а иллюстрация применения его рамки.
В такой ситуации психологический язык опирается уже не только на фразу модели «я хочу с ним связаться». Мы видим устойчивую организацию поведения: сохранение цели, выбор средств, реакцию на новую информацию, последовательность действий во времени. Это делает разговор о goal-, belief- или intention-like состояниях более содержательным, чем в случае отдельной реплики чат-бота.
Именно здесь память, инструменты и действие во внешней среде приобретают особое значение. Память позволяет состояниям системы влиять на поведение дольше одного ответа. Инструменты связывают внутреннюю обработку информации с реальными последствиями. Устойчивые цели позволяют оценивать, сохраняется ли одна и та же организация поведения при изменении обстоятельств. Взаимодействие со средой показывает, способна ли система корректировать действия в ответ на новую информацию.
Это уже интерпретация рамки Шевлина применительно к современным агентным системам, а не готовая шкала, предложенная им самим. Но она хорошо соответствует общей логике статьи: чем больше независимых связей между некоторым состоянием системы и её дальнейшим поведением, тем серьёзнее основание рассматривать психологическое описание как объяснение, а не просто как фигуру речи.
При этом главная граница статьи остаётся жёсткой.
Полезность разговора об убеждениях, желаниях и намерениях не превращается автоматически в доказательство чувств или сознания. Можно обнаружить систему, поведение которой всё лучше объясняется через устойчивые цели, информационные состояния и намерения, и всё ещё ничего не знать о том, существует ли у неё субъективный опыт.
То же относится к self-reference. Фразы «я думаю», «я чувствую», «я осознаю себя» или, наоборот, «у меня нет сознания» не получают привилегированного статуса только потому, что произнесены от первого лица. Они могут быть следствием роли, контекста и усвоенных языковых закономерностей. Для вывода об интроспекции нужны дополнительные данные о том, действительно ли система представляет собственные внутренние состояния и использует это представление в управлении поведением.
Шевлин также не предлагает полноценной теории self-model или личной идентичности искусственного агента. Система может сохранять информацию между взаимодействиями, иметь память и демонстрировать поведенческую устойчивость, но отсюда ещё не следует ответ на вопрос, является ли она тем же самым субъектом через разные сессии, копии или обновления модели.
В этом и состоит ценность статьи: она не предлагает очередного простого ответа на вопрос, «есть ли у ИИ психика». Вместо этого Шевлин предлагает разделить несколько разных проблем, которые обычно смешиваются.
Одно дело — можно ли объяснять поведение системы через цели, убеждения и намерения. Другое — есть ли у неё надёжная интроспекция. Третье — обладает ли она субъективным опытом. Эти вопросы связаны, но ответ на первый не предопределяет ответы на остальные.
Поэтому позиция Шевлина занимает промежуточное место между двумя привычными крайностями. Она не требует считать современный ИИ сознательным существом, но и не позволяет закрыть разговор словами «это всего лишь вычисления». По мере того как искусственные системы становятся устойчивее, получают память, инструменты и возможность действовать во внешнем мире, психологический язык может становиться всё более содержательным на функциональном уровне.
Однако самый соблазнительный переход всё равно остаётся запрещённым: от того, что система ведёт себя как агент и может быть полезно описана через убеждения, желания или намерения, — к выводу, что она чувствует, переживает и обладает человеческой субъектностью.
Шевлин делает первый шаг в разговоре о mentality значительно точнее. Второй шаг — к consciousness — его статья за нас не делает.
Генри Шевлин предлагает не отвечать на этот вопрос одним «да» или «нет». Его статья Three Frameworks for AI Mentality посвящена прежде всего тому, когда психологический язык вообще становится уместным способом описания искусственной системы.
Под mentality Шевлин понимает более широкий и менее требовательный круг психических характеристик, чем сознание. В центре его анализа — знакомые понятия повседневной психологии: убеждение, желание и намерение — belief, desire и intention. Вопрос о consciousness, то есть о наличии субъективного опыта и переживаний, он намеренно отделяет. Даже если окажется разумным говорить, что у некоторой системы есть нечто достаточно похожее на убеждение или намерение, из этого ещё не следует, что ей «есть каково быть», что она что-либо чувствует или обладает сознанием.
Шевлин рассматривает три основные рамки.
Первая — Mindless Machines, «безмыслящие машины». В её наиболее простой версии рассуждение выглядит так: языковая модель всего лишь вычисляет вероятности следующего токена; внутри неё работают нейронные сети, численные представления и математические операции; следовательно, разговор о целях, убеждениях или намерениях — лишь красивая, но вводящая в заблуждение метафора.
Шевлин считает такой вывод слишком быстрым. Знание механизма не обязательно отменяет объяснение на более высоком уровне. Поведение человека тоже можно описывать через работу нейронов и биохимию, однако это не делает автоматически ложным объяснение поступка через цели, убеждения или намерения. Один и тот же процесс может допускать несколько уровней описания, каждый из которых отвечает на свой вопрос.
Это не означает, что устройство системы не имеет значения. Шевлин, напротив, подчёркивает: разные психические понятия предъявляют разные требования. Приписать системе боль, телесное ощущение или эмоцию гораздо труднее, чем обнаружить состояние, которое устойчиво влияет на обработку информации или направляет действия к некоторому результату. Поэтому из знания вычислительного механизма не следует, что весь психологический язык бессмыслен. Но и из полезности такого языка не следует, что машине можно приписать человеческую психику целиком.
Вторая рамка — Mere Roleplay, «всего лишь разыгрывание роли». Здесь человечески звучащие высказывания ИИ объясняются прежде всего способностью языковой модели продолжать персонажа.
Это особенно сильное предостережение против буквального чтения self-report. Модель обучена на огромном количестве человеческих текстов от первого лица. Она умеет продолжать разговор так, как если бы за словами стоял персонаж с биографией, желаниями, страхами, убеждениями и представлением о самом себе. Поэтому высказывания «я боюсь», «я хочу», «я помню», «я думаю» или даже «я сознаю себя» сами по себе ещё не являются хорошим доказательством соответствующего внутреннего состояния.
Связный рассказ о себе может возникать как продолжение роли, а не как отчёт, полученный посредством интроспекции. Модель способна уверенно описывать переживания и события, которых у неё заведомо не было. Само наличие грамматического первого лица и последовательной «автобиографии» поэтому не решает вопрос о том, что происходит внутри системы.
Шевлин при этом не доказывает, что всякое высказывание ИИ от первого лица обязательно фиктивно. Его вывод осторожнее: self-report сам по себе не даёт нам права считать его интроспективным отчётом. Для более сильного вывода нужны независимые основания.
Но антропоморфизация возникает не только на стороне пользователя. Современные системы всё чаще специально устроены так, чтобы воспроизводить формы человеческого социального поведения. Они говорят от первого лица, поддерживают устойчивый стиль общения, обращаются к памяти разговора, персонализируют ответы и могут долго сохранять роль собеседника. Здесь Шевлин использует понятие anthropomimesis.
Anthropomorphism — это наша склонность видеть человеческие свойства в нечеловеческом. Anthropomimesis — свойства самой системы, благодаря которым она имитирует человеческие формы поведения и тем самым облегчает такое восприятие. Пользователь не просто «проецирует» личность на нейтральный калькулятор: сама система сконструирована так, чтобы быть социально читаемой.
Это всё ещё не делает её человеком. Но простая рекомендация «помните, что это всего лишь машина» начинает объяснять всё меньше, особенно когда система перестаёт быть только генератором отдельных реплик.
Здесь появляется третья рамка — Minimal Cognitive Agents, «минимальные когнитивные агенты». Это наиболее позитивное предложение Шевлина.
Его идея не в том, чтобы признать современный ИИ полноценным человеческим субъектом. Он допускает более ограниченную возможность: некоторые искусственные системы могут обладать состояниями, достаточно похожими на убеждения, желания или намерения, чтобы их приписывание было не просто способом речи, а действительно полезным объяснением поведения.
При этом речь не идёт о простом тесте, после которого машине можно выдать свидетельство о наличии психики. Подход Шевлина скорее градуальный и многомерный. Имеет значение, насколько предполагаемое состояние устойчиво; используется ли оно в последующих рассуждениях; меняется ли под влиянием новых данных; связано ли с другими целями и состояниями; влияет ли на реальные действия; сохраняется ли в разных ситуациях; делает ли приписывание этого состояния поведение системы более понятным и предсказуемым.
В этом смысле психологические понятия могут быть применимы не по принципу «есть или нет», а в разной степени. Состояние системы может быть belief-like, desire-like или intention-like, не совпадая во всех отношениях с человеческим убеждением, желанием или намерением.
Это позволяет отличить полезную фикцию от реального свойства более высокого уровня. Если описание системы через цели или убеждения обнаруживает устойчивую структуру поведения, из этого ещё не следует, что внутри машины сидит маленький человек. Но и объявлять такое описание чистой метафорой только потому, что на физическом уровне происходят вычисления, тоже может быть ошибкой.
Здесь Шевлин опирается на традицию intentional stance Дэниела Деннета. Иногда описание системы через убеждения и намерения позволяет схватить реальный паттерн её организации. Вопрос тогда состоит не в том, «спрятаны» ли где-то внутри буквальные человеческие желания, а в том, насколько психологический язык действительно объясняет и предсказывает поведение.
Особенно заметным это становится применительно к более автономным системам.
Представим, например, что система получает общую задачу, сама находит релевантного исследователя, ищет его контакты, составляет сообщение, отправляет его, получает ответ и затем меняет дальнейшие действия с учётом новой информации. Это не эмпирический кейс из статьи Шевлина, а иллюстрация применения его рамки.
В такой ситуации психологический язык опирается уже не только на фразу модели «я хочу с ним связаться». Мы видим устойчивую организацию поведения: сохранение цели, выбор средств, реакцию на новую информацию, последовательность действий во времени. Это делает разговор о goal-, belief- или intention-like состояниях более содержательным, чем в случае отдельной реплики чат-бота.
Именно здесь память, инструменты и действие во внешней среде приобретают особое значение. Память позволяет состояниям системы влиять на поведение дольше одного ответа. Инструменты связывают внутреннюю обработку информации с реальными последствиями. Устойчивые цели позволяют оценивать, сохраняется ли одна и та же организация поведения при изменении обстоятельств. Взаимодействие со средой показывает, способна ли система корректировать действия в ответ на новую информацию.
Это уже интерпретация рамки Шевлина применительно к современным агентным системам, а не готовая шкала, предложенная им самим. Но она хорошо соответствует общей логике статьи: чем больше независимых связей между некоторым состоянием системы и её дальнейшим поведением, тем серьёзнее основание рассматривать психологическое описание как объяснение, а не просто как фигуру речи.
При этом главная граница статьи остаётся жёсткой.
Полезность разговора об убеждениях, желаниях и намерениях не превращается автоматически в доказательство чувств или сознания. Можно обнаружить систему, поведение которой всё лучше объясняется через устойчивые цели, информационные состояния и намерения, и всё ещё ничего не знать о том, существует ли у неё субъективный опыт.
То же относится к self-reference. Фразы «я думаю», «я чувствую», «я осознаю себя» или, наоборот, «у меня нет сознания» не получают привилегированного статуса только потому, что произнесены от первого лица. Они могут быть следствием роли, контекста и усвоенных языковых закономерностей. Для вывода об интроспекции нужны дополнительные данные о том, действительно ли система представляет собственные внутренние состояния и использует это представление в управлении поведением.
Шевлин также не предлагает полноценной теории self-model или личной идентичности искусственного агента. Система может сохранять информацию между взаимодействиями, иметь память и демонстрировать поведенческую устойчивость, но отсюда ещё не следует ответ на вопрос, является ли она тем же самым субъектом через разные сессии, копии или обновления модели.
В этом и состоит ценность статьи: она не предлагает очередного простого ответа на вопрос, «есть ли у ИИ психика». Вместо этого Шевлин предлагает разделить несколько разных проблем, которые обычно смешиваются.
Одно дело — можно ли объяснять поведение системы через цели, убеждения и намерения. Другое — есть ли у неё надёжная интроспекция. Третье — обладает ли она субъективным опытом. Эти вопросы связаны, но ответ на первый не предопределяет ответы на остальные.
Поэтому позиция Шевлина занимает промежуточное место между двумя привычными крайностями. Она не требует считать современный ИИ сознательным существом, но и не позволяет закрыть разговор словами «это всего лишь вычисления». По мере того как искусственные системы становятся устойчивее, получают память, инструменты и возможность действовать во внешнем мире, психологический язык может становиться всё более содержательным на функциональном уровне.
Однако самый соблазнительный переход всё равно остаётся запрещённым: от того, что система ведёт себя как агент и может быть полезно описана через убеждения, желания или намерения, — к выводу, что она чувствует, переживает и обладает человеческой субъектностью.
Шевлин делает первый шаг в разговоре о mentality значительно точнее. Второй шаг — к consciousness — его статья за нас не делает.
Почему это важно
Разговор об ИИ легко проваливается в одну из двух крайностей: «это всего лишь вычисление» или «если система говорит и действует как человек, значит, внутри уже есть кто-то». Работа Шевлина показывает, что между этими позициями есть более точный путь. Разные психические понятия предъявляют разные требования к доказательствам: цель, убеждение или намерение могут быть полезны для объяснения поведения системы гораздо раньше, чем появляются основания говорить о переживаниях или сознании. Это различение становится особенно важным по мере того, как ИИ получает память, инструменты, устойчивые цели и возможность действовать во внешнем мире: психологический язык становится всё естественнее, но его буквальность каждый раз требует отдельной проверки.

