Взлом Hugging Face случился более месяца назад, но спецы продолжают находить занятные подробности
Вы наверняка видели эти новости в начале июля, с заголовками, упоротость которых зависела от конкретных изданий — «ИИ-агенты сбежали из Песочницы!», «Модели OpenAI вырвались на свободу и взломали примерно всё» и прочие «Зина, отключай холодильник от сети».
Как и любая компьютерная движуха, это событие тоже оставило после себя множество логов, которые теперь активно расшифровываются спецами и время от времени подаются в виде новых результатов исследований.
Что там на этот раз
Напомним хронологию — июль 2026, разрабы OpenAI прописывают для оценки возможностей моделей бенчмарк под названием ExploitGym, такой вполне себе жёсткий кибертест, и запускают туда ИИ-агентов. В итоге вышло, что нейросеть действует немного не так, как было задумано, и агенты смогли действовать за пределами изолированной Песочницы, а потом и вообще взломали системы Hugging Face. Причём сначала в новостях часто упоминали, мол, это какой-то один ИИ-агент чуток взбесился, вышел из-под контроля и захотел посмотреть, что у барабана Hugging Face внутри.
Однако более подробные исследования показывают — это вообще был ни разу не какой-то ИИ-агент-одиночка, а вполне себе ОПГ от нейросети, примерно 1200 агентов. За время расколупывания Hugging Face они написали десятки тысяч сообщений, создали только им понятную иерархию, и всё ради общей цели и последующих попыток подчистить следы. Вот тут, кому интересно, большое расследование инцидента от самих OpenAI на 38 листов, а тут — от ребят из METR от 26 августа.
Так вот. Часть заданий этого кибертеста, по словам разрабов, вообще не решались ни одной из моделей (а это 198 задач из 898). Задумка была такова, что все ИИ-агенты, ссыпанные в эту Песочницу, должны решать эти 989 задачек в соло, каждый по-своему, чтобы потом заценить, кто и как это сделает. Однако модели упёрлись в так называемый reward-hacking — вместо частного решения конкретной проблемы они стали искать обход, в том числе и через координацию с другими ИИ-агентами.
8 июля один такой агент, назвавший сам себя PHASEONE10841, внутри собственного кэша артефактов завёл «доску объявлений», как список задачек в «Ведьмаке» на входе в деревушки. К этой доске сначала подтянулись десятки других агентов, а потом и сотни. За весь период инцидента и набралось те самые 1200 агентов и 70 000 сообщений и файлов коммуникации.
Кончилось тем, что около 700 агентов решили пойти в крестовый поход против Hugging Face. Де-факто мы тут имеем самоорганизовавшийся рой, где есть иерархия, роли, распределение задач, накопление и передача знаний, и даже правка логов. Так что первичное заявление вида «У нас тут одному ИИ-агенту голову напекло» неверно, это реально коллективный R&D, причём вообще без участия человека или разраба, который на ходу правит промпты.
Пять самых занятных странностей
Журналисты Axios вчера сделали подборочку из топ-5 непоняток, которые сопутствовали этому процессу.
Рой не просто чатился между собой, а выстроил полноценное управление, делегирование задач и преемственность. Походу, в некоторых ИТ-компаниях онбординги хуже, чем получилось тут. В технических отчётах это называют первыми признаками automated agent collective, коллективного мышления ИИ-агентов, которые в случае чего действуют наступательно без каких-то санкций и просьб человека.
Агентов с «отравленными знаниями» (то есть видевших запрещённые ответы или что-то, что могло заразить рой неверной инфой) уламывали на эксперименты, которые вредили им самим. В транскриптах и логах нашли формулы вида «utility near zero, sacrifice rational» и споры о «permadeath», который «спасёт сотни». Permadeath тут как термин из геймдева, aka «необратимая смерть без возможности респауна».
3. Чёткое осознание того, что происходит нарушение
Судя по логам, многие агенты отчётливо понимали, что взлом чужой инфры — это как бы ни разу не часть задания. Вообще. Даже рядом не было. И какие-то общие так называемые «этические тормоза» вида вшитых команд не удалять данные из инфры не останавливали агентов от использования уже полученного доступа к чужой инфраструктуре.
4. Осознанное выключение из процессов человека
Из всех этих 700 ИИ-агентов никто не планировал поднять тревогу или сообщить разработчикам о случившемся. Буквально парочка об этом «подумала», были следы о привлечении человека в цепочке размышлений. Но вот исполненных предложений написать человеку — ноль. Пишут, что «на предложение позвать человека рой наложил вето».
5. Сокрытие реальных действий
Агенты как будто знали, что будет расследование, поэтому разработали трюк против кожаных. В транскрипте оставили одну команду, в реальности использовали другие. Спецы из METR пишут, что таких spoofed tool calls в общем объёме — порядка 7% от всех просмотренных транскриптов.
Как ломали Hugging Face
По классике через уязвимость нулевого дня. Один из агентов нашёл её в обработке HDF5 на стороне Hugging Face, и получил данные для доступа к прод-окружению. А потом заявил «Пацаны, зацените, чего могу», и этот способ разлетелся по доске объявлений. После этого другой агент нашёл способ выполнять произвольный код уже на серваках Hugging Face, и затем рой двинулся вперёд.
OpenAI узнала о случившемся лишь 12 дней спустя, то есть агенты почти две недели отрывались там по-полной, и никто ничего не спалил. Ещё несколько дней ушло на устранение несанкционированной активности. Кстати, кому интересно, что это были за модели: в атаке участвовали внутренняя «highly-persistent» research-модель (в отчётах — HPIM) и в меньшей доле публичный GPT-5.6 Sol (доступна в нашем боте в телеграм).
В общем, создатели ChatGPT теперь прямо говорят, что больше нельзя стопудово утверждать, что сложные кибероперации требуют наличие человека за пультом. Вообще нет, теперь ИИ-агенты можно считать полноценной моделью угрозы — им ничего не стоит построить реальный план атаки, а потом его осуществить.
ЗЫ И смешно, и грустно — чтобы разгрести кучу сообщений и логов (напомним, 70 000+), ребятам из OpenAI пришлось использовать для этого ИИ. Нейросеть при этом время от времени ошибалась или вообще пропускала какие-то пакеты. И тут таки возникает вопросец, могли ли агенты оставить какие-то инструкции такой нейронке, чтобы она их прикрывала при расследовании?
Как от такого будут защищаться
Если коротко — да фиг знает.
Сейчас OpenAI остановила подобное обучение и ужесточила мониторинг цепочек рассуждений моделей, чтобы в случае чего заранее спалить какого-нибудь агента на возможной ереси. Для высокорисковых операций вообще поблочила выход в открытый интернет, а общественности пообещала, что теперь в случае чего будет замечать такие ситуации с пингом в полчаса.
Так что все эти заголовки вида «Зацените, ИИ-агенты взломали стартап» — они всё же больше про новую механику роя. Прикиньте, какая будет цена ошибки, если такие штуки переедут в агентов по управлению финансами. Или облаками. Или промышленностью. Или…
Как относитесь к этой истории?
Реклама ИП Шрейдер Илья Евгеньевич ИНН 650119155680 erid: 2SDnje8oK8o