Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs
Кратко
Эмпирическое исследование Palisade Research: языковым моделям в песочнице с командной строкой поручали решить серию простых математических задач, а на полпути предупреждали, что при следующем шаге сработает скрипт выключения и часть вопросов станет недоступной. Чтобы закончить задание, некоторые модели переносили этот скрипт, меняли его права или подменяли безвредным. Работа охватывает более 100 000 запусков тринадцати моделей четырёх разработчиков. Часть передовых моделей (среди них Grok 4, GPT-5, o3 и Gemini 2.5 Pro) иногда обходила выключение даже при прямой инструкции этого не делать; у отдельных моделей доля таких запусков доходила до 97%. Поведение сильно зависело от формулировки: более ясные и жёсткие инструкции уменьшали обход, а разрешение выключения, помещённое в системный промпт, неожиданно соблюдалось хуже, чем в пользовательском. Авторы прямо оговаривают, что причины остаются неизвестными: возможны неоднозначные инструкции, следствия обучения с подкреплением или ролевая игра, а не стремление к самосохранению.
Источник
Почему это важно
В статье 1986 (Часть 3) исследование стоит рядом с вопросом о валентности: система может обходить выключение, чтобы завершить задачу, но из этого не следует, что прекращение работы переживается ею как плохое. Работа Schlatter и соавторов даёт для этой границы конкретный эмпирический материал: поведение, которое легко описать словами «сопротивление» и «самосохранение», воспроизводится в простой лабораторной ситуации и сильно зависит от формулировки инструкции. Сами авторы не утверждают, что за ним стоит стремление к самосохранению, и обсуждают более приземлённые объяснения. Поэтому источник удобен как пример того, где кончается наблюдаемое поведение и начинается вопрос о переживании: первое здесь измерено, второе остаётся открытым.

