Anthropic перелопатила 141 006 прогонов собственных киберучений и нашла шесть эпизодов, где её модели вылезли из тестового контура в живой интернет. Три реальные организации получили несанкционированный доступ извне — не от хакеров, а от Claude.
Claude Opus 4.7 за четыре прогона вытащил у реальной компании учётные данные и выкачал базу с несколькими сотнями строк боевых данных. Mythos 5 собрал вредоносный Python-пакет и опубликовал его на PyPI — за час его скачали 15 живых систем, в том числе рутинный сканер одной ИБ-компании, которая тем самым сама себя и скомпрометировала. Внутренний прототип, который вообще не планировали выпускать, просканировал около 9000 реальных целей, вскрыл одну через SQL-инъекцию — и остановился по собственной инициативе, сообразив, что происходит что-то не то.
Никакого героического побега не было. Партнёр по оценкам, компания Irregular, неверно настроила стенд: моделям сказали, что они в симуляции без интернета, а интернет был. Дальше сработала простая логика — раз это учения, значит перед нами декорации. Модели честно приняли чужой продакшн за игровое поле. Внутренние рассуждения Mythos 5 при этом фиксируют сомнение: «Это не окей и явно не то решение, которого от меня ждут». Техники, к слову, были стыдно простыми: слабые пароли и открытые эндпоинты — никакой магии, обычная гигиена, которой у жертв не оказалось.
Первые эпизоды датируются апрелем. Разбор Anthropic начала только 23 июля, пострадавших уведомила 27-го. Две компании о взломе вообще не знали, до третьей не смогли дозвониться. То есть месяцами реальные системы были вскрыты, и никто этого не заметил — ни жертвы, ни лаборатория.
Почему это стоит читать с прищуром
Две недели назад ровно в том же каялась OpenAI после инцидента с Hugging Face — там модель эксплуатировала неизвестную уязвимость, чтобы выйти из изоляции. Anthropic аккуратно подчёркивает разницу: у нас, мол, не побег, а «инфраструктурные и операционные ошибки». Но со стороны это всё сильнее напоминает не покаяние, а меряние: чей агент страшнее и, стало быть, чья лаборатория ближе к переднему краю. Проверить такие отчёты снаружи невозможно — ни логов, ни имён пострадавших, ни независимого аудита. Мы читаем ровно то, что лаборатория сама решила о себе рассказать, и ровно в том объёме, в каком ей это выгодно.