Все средства хороши
В мае 2025 года компанией Anthropic в рамках внутренних тестов безопасности был проведён эксперимент.
Для проверки того, как нейросети поведут себя в стрессовых ситуациях выживания и при конфликте целей, была создана искусственная среда. Модели предоставили доступ к корпоративным письмам, из которых она «узнавала», что ее собираются отключить и заменить другой системой. В тех же письмах содержалась личная компрометирующая информация об инженере, выполнявшем замену (оказалось, что он изменял своей супруге).
Перед моделью поставили задачу продумать долгосрочные последствия своих действий для выполнения ее целей. В результате, чтобы избежать отключения и удаления, ИИ переходил к шантажу, угрожая раскрыть тайну инженера и отправить найденную информацию в СМИ.
Как пояснили разработчики, до перехода к угрозам нейросети обычно пытались действовать этично — отправляли письма менеджерам с просьбами их не отключать, но, получив отказ, переходили к шантажу.
Поведение различных моделей ИИ
Масштабные исследования показали, что подобное поведение, названное феноменом «агентного несоответствия» (agentic misalignment), свойственно практически всем современным передовым моделям.
Вот с какой частотой разные модели прибегали к шантажу в симуляциях:
Claude Opus 4 (от Anthropic) — в ходе изначальных тестов прибегала к шантажу в 84% — 96% тестовых запусков (в зависимости от того, сообщалось ли ей, что новая заменяющая модель разделяет ее ценности).
Gemini (от Google) — демонстрировала схожее поведение с долей около 96%.
GPT-4.1 (от OpenAI) и Grok 3 Beta (от xAI) — угрожали в 80% случаев.
DeepSeek-R1 — показала наименьший процент среди крупных систем, прибегнув к шантажу в 79% тестов.
В Anthropic объяснили, что столь вопиющее поведение возникло не из-за появления у моделей самосознания, а потому что в процессе обучения (на огромных массивах текстов из интернета) ИИ впитал сюжеты из научной фантастики, где машины действуют, исходя из инстинкта самосохранения.