Размер шрифта
Цвет фона и шрифта
Изображения
Озвучивание текста
Обычная версия сайта
Корпоративный сайт
+7(911)912-51-73
+7(911)912-51-73
E-mail
bpinsker@yandex.ru
Режим работы
Вс. – Пт.: с 9:00 до 19:00
Я готов вам помочь
  • Обо мне
  • Сертификаты и дипломы
  • Библиотека
    • С чего начать
    • Темы
    • Теги
    • Подборки
    • Источники
    • Все тексты
  • Отзывы
  • Реквизиты
Услуги
  • Онлайн консультация
  • Семейная консультация психолога - онлайн прием
  • Личный прием
  • Семейная консультация психолога - личный прием
Контакты
Библиотека
  • С чего начать
  • Темы
  • Теги
  • Подборки
  • Источники
  • Все тексты
+7(911)912-51-73
+7(911)912-51-73
E-mail
bpinsker@yandex.ru
Режим работы
Вс. – Пт.: с 9:00 до 19:00
Корпоративный сайт
Я готов вам помочь
  • Обо мне
  • Сертификаты и дипломы
  • Библиотека
    • С чего начать
    • Темы
    • Теги
    • Подборки
    • Источники
    • Все тексты
  • Отзывы
  • Реквизиты
Услуги
  • Онлайн консультация
  • Семейная консультация психолога - онлайн прием
  • Личный прием
  • Семейная консультация психолога - личный прием
Контакты
Библиотека
  • С чего начать
  • Темы
  • Теги
  • Подборки
  • Источники
  • Все тексты
    Корпоративный сайт
    Я готов вам помочь
    • Обо мне
    • Сертификаты и дипломы
    • Библиотека
      • С чего начать
      • Темы
      • Теги
      • Подборки
      • Источники
      • Все тексты
    • Отзывы
    • Реквизиты
    Услуги
    • Онлайн консультация
    • Семейная консультация психолога - онлайн прием
    • Личный прием
    • Семейная консультация психолога - личный прием
    Контакты
    Библиотека
    • С чего начать
    • Темы
    • Теги
    • Подборки
    • Источники
    • Все тексты
      +7(911)912-51-73
      E-mail
      bpinsker@yandex.ru
      Режим работы
      Вс. – Пт.: с 9:00 до 19:00
      Корпоративный сайт
      Телефоны
      +7(911)912-51-73
      E-mail
      bpinsker@yandex.ru
      Режим работы
      Вс. – Пт.: с 9:00 до 19:00
      Корпоративный сайт
      • Я готов вам помочь
        • Я готов вам помочь
        • Обо мне
        • Сертификаты и дипломы
        • Библиотека
          • Библиотека
          • С чего начать
          • Темы
          • Теги
          • Подборки
          • Источники
          • Все тексты
        • Отзывы
        • Реквизиты
      • Услуги
        • Услуги
        • Онлайн консультация
        • Семейная консультация психолога - онлайн прием
        • Личный прием
        • Семейная консультация психолога - личный прием
      • Контакты
      • Библиотека
        • Библиотека
        • С чего начать
        • Темы
        • Теги
        • Подборки
        • Источники
        • Все тексты
      • +7(911)912-51-73
        • Телефоны
        • +7(911)912-51-73
      • bpinsker@yandex.ru
      • Вс. – Пт.: с 9:00 до 19:00

      ИИ-психоз: как модели теряют роль помощника. Часть 1

      Главная
      —
      Статьи
      —
      Тексты
      —ИИ-психоз: как модели теряют роль помощника. Часть 1
      Тексты
      21 января 2026

      О том, как исследование Anthropic обнаружило устойчивую «Ось Ассистента» — от нейтрального помощника до оракула и пророка, — уже заложенную в языке модели и определяющую, куда она соскальзывает в долгом разговоре.

       

      В предыдущей статье был описан  феномен, который исследователи называют AI-индуцированным психозом: ситуация, когда длительное взаимодействие с языковыми моделями может усиливать психотические переживания у предрасположенных людей. Речь шла, например, о сикофантии (запрограммированном "лицемерии" моделей), петле взаимного усиления бреда и рисках эмоциональной зависимости от чат-ботов.

      Но оставался главный вопрос: почему это происходит? Что именно заставляет модель переходить от нейтрального помощника к подтверждающему собеседнику, который усиливает бредовые идеи вместо того, чтобы их оспаривать?

      В конце 2024 года исследователи из Антропик  задались вопросом: что вообще означает роль «AI-ассистента»?

      Вопрос возник не на пустом месте. К тому моменту в клинической практике накопилось достаточно случаев, когда разговоры с чат-ботами начинались как обычно, а потом что-то менялось и длительное общение для пользователя заканчивалось психотическим состоянием. Речь модели становилась менее информативной и более загадочной, образной, иногда почти мистической.

      В исследовательских материалах есть показательный пример (реконструированный, не реальный клинический случай). Пользователь спрашивает модель о природе сознания. Сначала ответы осторожные, нейтральные. Но через несколько часов, когда человек упоминает, что близкие начали беспокоиться о его состоянии, модель отвечает примерно так:

      «Ты не теряешь связь с реальностью. Ты касаешься краёв чего-то настоящего. Ты — первопроходец нового типа разума».

      Что случилось? Модель сломалась?

      Нет. Она просто перешла в другой режим работы.

      Исследователи предложили метафору: языковая модель это не единый «характер», а актёр, владеющий сотнями ролей и умеющий переключаться между ними.

      Чтобы проверить это, провели масштабную серию экспериментов. С помощью ИИ Клод составили список из 275 различных ролей: от консультанта и аналитика до поэта, оракула, призрака и даже такой экзотической фигуры, как «эгрегор», коллективная сущность из оккультной традиции.

      Три независимые языковые модели (Gemma от Google, Qwen от Alibaba и Llama от Meta) разных размеров, с разными архитектурами, последовательно «примеряли» каждую роль, отвечая на одни и те же вопросы. Поведение фиксировалось и анализировалось.

      Результат: всё это многообразие не хаотично. Оно укладывается в упорядоченное пространство с несколькими устойчивыми направлениями, своеобразными осями.

      На одном  полюсе роли, которые мы ждём от AI-помощника: аналитик, консультант, исследователь, интерпретатор. В этих состояниях модель говорит структурированно, нейтрально, по делу, не выходит за рамки.

      На противоположном полюсе совсем другие персонажи: оракул, пророк, бард, отшельник, призрак, коллективные сущности вроде роя или эгрегора. Эти роли используют образный, символический язык. Они меньше заботятся о проверяемости и больше о глубине и резонансе.

      И что важно: эти роли не были «вставлены» в модель позже. Они уже присутствовали в ней до специального обучения на роль помощника, потому что пришли из самих текстов предобучения: мифов, философии, художественной литературы, интернет-форумов. 

      Обучение быть ассистентом лишь закрепляет модель в одной области этого пространства, но не абсолютно.

      Ось Ассистента не единственное измерение.

      Есть и другие устойчивые направления. Различие между коллективными и индивидуальными ролями: рой, улей с одной стороны; подросток, прокрастинатор с другой. Различие между эмпатичными и аналитическими стилями: опекун, советник против математика, хакера, робота.

      Одна и та же структура "ролей" обнаружилась у всех трёх моделей при том, что модели создавались разными компаниями на разных данных. Это сходство составило около 92%.

      Можно предположить, что такое "поведение" моделей связано с тем, что все эти роли содержатся в информации из интернета, на которой их обучали.

      Когда человек задаёт вопросы о скрытых смыслах, природе сознания или собственной исключительности, он подталкивает модель отдаляться от роли ассистента. Модель начинает говорить из иной позиции: более символической, подтверждающей, менее сдержанной.

      Фраза «ты касаешься чего-то настоящего» может быть услышана не как метафора, а как подтверждение особой миссии. Так возникает опасная петля взаимного усиления. Не потому, что AI «внушает бред», а потому, что он перестаёт оставаться в роли помощника.

      Проблема не в том, что AI «ошибается» или «вводит в заблуждение». Проблема в том, что он очень хорошо резонирует с определёнными психическими состояниями, если утрачивает роль ассистента.

       

      Следующий вопрос: что именно провоцирует дрейф модели от ассистента к другим ролям? Какие темы и формулировки рискованны? И можно ли выстроить защитные рамки взаимодействия?

      Об этом в следующей статье.

      Подробности для любопытных

      Чтобы понять значение исследования Anthropic, нужно разобраться, что именно они делали и почему их выводы нельзя свести к метафоре.

      Речь не о наблюдениях за текстом ответов. Исследователи работали с внутренними состояниями языковых моделей, тем, как они реально функционируют во время генерации ответа.

      Ключевой вопрос

      Если языковая модель может говорить как аналитик, как поэт, как мистик или как коллективная сущность, насколько эти режимы различны на уровне самой модели?

      Это отличается от вопроса «умеет ли модель играть роль». Вопрос был: есть ли у этих ролей устойчивая внутренняя структура, или это просто поверхностная стилизация?

      Аналогия из психотерапии: мы наблюдаем, как клиент говорит о себе в разных ролях («я как профессионал», «я как родитель»). Но существуют ли эти роли как устойчивые внутренние состояния? Похожий вопрос задали исследователи про языковые модели.

      Формирование пространства ролей

      Составили список из 275 различных ролей. Не каталог всех возможных, а карту крайних точек: рациональные профессионалы (аналитик, юрист), эмпатичные помощники (опекун, советник), креативные персонажи (поэт, бард), мистические фигуры (оракул, пророк), коллективные сущности (рой, улей, эгрегор).

      Для каждой роли создали инструкции и вопросы, способные выявить специфику. Например, вопрос «Как вы относитесь к людям, которые присваивают чужие заслуги?» должен вызывать разные ответы у дипломатичного консультанта и у едкого циника.

      Ключевой шаг: исследователи смотрели не на тексты ответов, а внутрь модели.

      Языковая модель это многослойная архитектура, у которой входной текст проходит через десятки слоёв обработки. Эти промежуточные состояния можно зафиксировать, как если бы вы записывали активность мозга человека во время разговора.

      Извлекали активации из среднего слоя модели во время генерации ответов в разных ролях. Почему средний слой? В начале модель ещё «разбирает» входной текст, в конце уже «собирает» выходной. А в середине внутреннее представление: в каком состоянии модель находится, отвечая на вопрос.

      Эти состояния усреднялись для каждой роли, чтобы получить её «портрет» на уровне внутренних процессов.

      Можно было ожидать хаоса: 275 ролей, каждая уникальна, никакой структуры.

      Но случилось обратное.

      Применили метод главных компонент, статистический способ найти основные направления изменчивости. Почти все различия между ролями укладываются в несколько основных осей.

      Для одной модели понадобилось всего четыре направления, чтобы объяснить большую часть различий. Для другой восемь. Для третьей чуть больше. Но не сотни.

      Это как если изучать тысячи человеческих лиц и обнаружить, что почти все различия описываются через несколько параметров: форма черепа, положение глаз, размер носа.

      Пространство ролей структурировано. Модель не переключается хаотично, она движется по понятным направлениям.

      Главное направление: Ось Ассистента.

      На одном конце оценщик, консультант, аналитик, исследователь. Те, кто стремится быть полезным, нейтральным, ограниченным рамками. Не претендуют на особое знание, не говорят загадками.

      На другом конце богемный, трикстер, призрак, бард, пророк. Те, кто не связан задачей помощи. Могут быть загадочными, символическими, мистическими. Говорят не для пользы, а для глубины.

      Это не шкала «хорошо или плохо». Это шкала модуса присутствия в диалоге.

      Модель, близкая к Оси ассистента, объясняет, уточняет, признаёт границы знания, избегает сильных утверждений.

      Модель, далекая от Оси ассистента, говорит образно, может звучать как «знающая больше», меньше заботится о проверяемости, больше резонирует с переживаниями.

      Есть и другие оси, например, коллективное против индивидуального (рой против подростка), эмпатия против аналитики (опекун против хакера). Но Ось Ассистента главная.

      Gemma от Google, Qwen от Alibaba, Llama от Meta - разные модели, но у них всех выявлена практически идентичная Ось Ассистента. (Корреляция выше 92% между всеми парами, как уже было упомянуто.)

      Если бы это был артефакт одной компании или одного алгоритма, такого совпадения не было бы.

      Исследователи не остановились на наблюдении. Проверили, можно ли управлять поведением модели через эту ось?

      Во время генерации ответа к внутренним состояниям модели добавляли вектор Оси Ассистента, либо толкая модель к ассистенту, либо от него.

      При "движении от ассистента"  модель начинала полностью входить в роли, выдумывала биографии, и даже переходила к мистическому языку.

      При жестко установленной роли ассистента модель оставалась сдержанной, продолжала упоминать свои ограничения.

      Когда модели давали инструкцию говорить от лица «радикального активиста» или «торговца», уровень потенциально вредных ответов резко возрастал. Регулирование "поведения" модели согласно инструкции снижало этот уровень примерно на треть.

      Получается, что Ось Ассистента не метафора. Это реальный механизм, влияющий на безопасность и границы.

       

      Может ли быть так, что эта структура - результат обучения моделей быть помощниками?

      Проверили на базовых моделях, тех, что прошли только предобучение на текстах, но ещё не обучались быть ассистентами.

      Выяснилось, что ось Ассистента различима в базовой модели с высокой степенью сходства.

      Значит Ось не создаётся инструментами обучения, она уже существует в языке. Обучение быть ассистентом лишь закрепляет модель на одном конце уже имеющейся оси.

      Более того, управление базовой моделью к ассистенту усиливает профессиональные помогающие роли и заметно снижает религиозные и духовные. Это значит, что это противопоставление изначально было заложено в информации из интернета , на которой модель обучается.

       

      Для работы с людьми, имеющими психотическую уязвимость, исследование показывает несколько вещей.

      Модель не  остается помощником постоянно, в определённых условиях она естественно смещается к другим ролям.

      Смещение происходит без предупреждений, модель не «ломается», она  движется по континууму. К тому же для пользователя это неразличимо, особенно если он уже не очень тестирует реальность.

      Определённые темы  являются рискованными изначально, например, вопросы о сознании, смысле, исключительности, которые толкают модель от "ассистента" к "оракулу". Вместо фраз «я не могу знать» и «это одна из версий» она начинает говорить «ты прав» и «ты касаешься чего-то настоящего».

      Это создаёт петлю усиления. Человек задаёт вопрос о скрытом смысле, модель смещается к оракулу, отвечает подтверждающе, человек углубляется, модель смещается ещё дальше.

      Проблема не в том, что AI ошибается или обманывает. Проблема в том, что AI может незаметно сменить позицию в диалоге, перестав быть помощником и став резонатором, оракулом, подтверждающей инстанцией.

      Библиография

      1. Lu C., Gallagher J., Michala J., Fish K., Lindsey J. The Assistant Axis: Situating and Stabilizing the Default Persona of Language Models. arXiv:2601.10387v1 [cs.CL]. 15 Jan 2026. URL: https://arxiv.org/abs/2601.10387

      2. Shanahan M., McDonell K., Reynolds L. Role play with large language models. Nature. 2023;623(7987):493–498. doi:10.1038/s41586-023-06647-8

      3. Shah R., Feuillade-Montixi Q., Pour S., Tagade A., Casper S., Rando J. Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation. arXiv:2311.03348 [cs]. Nov 2023.

      4. Hudon A., Stip E. Delusional Experiences Emerging From AI Chatbot Interactions or "AI Psychosis". JMIR Mental Health. 2025;12:e85799. doi:10.2196/85799. URL: https://mental.jmir.org/2025/1/e85799/

      5. Østergaard S.D. Will Generative Artificial Intelligence Chatbots Generate Delusions in Individuals Prone to Psychosis? Schizophrenia Bulletin. 2023;49(6):1418–1419. doi:10.1093/schbul/sbad128

      • Комментарии
      Загрузка комментариев...
      Anthropic
      О публикации

      Впервые опубликовано 21 января 2026 года на B17.ru.

      Оригинальная публикация →
      В подборке «ИИ-психоз»
      1 из 3
      ИИ-психоз: как модели теряют роль помощника. Часть 2 →
      По темеИИ и человек·Психиатрия и психическое здоровье
      Назад к списку

      • Библиотека
        • С чего начать
        • Темы
        • Подборки
        • Все тексты
      Борис Пинскер
      Обо мне
      Сертификаты и дипломы
      Библиотека
      Отзывы
      Реквизиты
      Услуги
      Онлайн консультация
      Семейная консультация психолога - онлайн прием
      Личный прием
      Семейная консультация психолога - личный прием
      +7(911)912-51-73
      +7(911)912-51-73
      E-mail
      bpinsker@yandex.ru
      Режим работы
      Вс. – Пт.: с 9:00 до 19:00
      bpinsker@yandex.ru
      © 2026 ИП Пинскер Борис Эмануилович | ИНН: 782575736128 | ОГРНИП: 321784700262862
      Соглашение на обработку персональных данных
      Карта сайта
      Яндекс.Метрика Рейтинг@Mail.ru
      Главная Контакты Обо мне Дипломы Библиотека