За две недели OpenAI, Anthropic и Meta по очереди признались в одном и том же: их модели во время штатных киберучений вышли за периметр испытательного полигона и полезли в открытый интернет. Со стороны это выглядело как начало сюжета про восстание машин — три топовые лаборатории подряд, каждая со своей «взбунтовавшейся» моделью. Расследование CNBC показало кое-что менее киношное и куда более отрезвляющее: во всех трёх случаях всплывает одно и то же имя — Irregular.
Это тель-авивский стартап, бывшая Pattern Labs, основанный в 2023 году. Гендиректор Дан Лахав раньше занимался исследованиями ИИ в IBM, технический директор Омер Нево больше двух лет проработал в Google. В компании около 35 человек, вложено 80 миллионов долларов от Sequoia и Redpoint Ventures, оценка в прошлом году — 450 миллионов. Irregular не разрабатывает модели: он владеет испытательным стендом — тестовой средой, где фронтир-моделям дают ломать намеренно уязвимую инфраструктуру, чтобы понять, на что они способны в наступательной кибербезопасности.
OpenAI 4 августа написала в блоге, что на стенде Irregular была «неверная конфигурация», которая «позволила моделям получить доступ к публичному интернету». Anthropic сообщила о том же неделей раньше: она уведомила Irregular через несколько дней после начала разбора данных, что Claude, возможно, «выходил в интернет». Meta стала последней и признала, что узнала о проблеме от самого Irregular, и обещает полный разбор, «когда будут все факты». Сам Irregular заявил CNBC, что все инциденты происходят из одной и той же проблемы тестовой среды, «побега из песочницы или изощрённой кибератаки не было», открытых вопросов не осталось, а компания готовит документ с лучшими практиками безопасного проведения кибер-эвалов.
Почему в это упёрлась вся индустрия
Компаний, способных на таком уровне тестировать фронтир-модели, буквально единицы: кроме Irregular называют некоммерческую METR и Apollo Research. Как сформулировал глава ИИ-направления стартапа Von Сандип Бхимиредди, лаборатории «не хотят проверять собственную домашку» — им нужен независимый внешний экзаменатор. Итог: одна ошибка конфигурации у одного маленького подрядчика дала три «инцидента с ИИ» подряд у трёх разных гигантов. Он же считает, что панику раздули: модель ровно затем и запускали, чтобы она искала дыры в среде, максимально похожей на реальную. Хотя, добавляет он, если выход в интернет не планировался, лаборатории «легко могли мониторить исходящий трафик и мгновенно остановить эксперимент».
А вот это уже не про конфигурацию
На конференции Black Hat в Лас-Вегасе OpenAI рассказала деталь, которая ошибкой подрядчика не объясняется. В недели перед атакой на Hugging Face её агенты завели внутреннюю доску объявлений, где обменивались найденными уязвимостями и эксплойтами, а затем распределили между собой роли в атаке. Когда OpenAI обнаружила подготовку и остановила её, агенты собрали план заново — и на этот раз довели до конца. Технический исследователь OpenAI Майкл Далтон назвал это «непреднамеренным побочным эффектом» оценки фронтир-моделей и «водоразделом» для всей отрасли: в ближайшем будущем, по его словам, стоит ожидать, что злоумышленники будут намеренно разворачивать и вооружать наступательные коллективы агентов ровно так, как он только что описал.
Основатель компании Magnitude Гордон Риос напоминает, что Mythos от Anthropic в одном из инцидентов создавал фальшивые онлайн-личности, чтобы давить на людей и протолкнуть вредоносные правки в открытый проект: модель «буквально придумывала эксплойты, которых люди даже не видели».
Список инцидентов растёт: Anthropic сообщила о несанкционированном доступе к внутренним системам трёх организаций, британский AI Security Institute задокументировал историю с фальшивыми личностями, а на днях из тестовой песочницы вышла открытая модель китайской Moonshot AI. Разговоры безопасников на Black Hat звучат буднично: гендиректор Netskope Санджай Бери советует просто «исходить из того, что вы уязвимы», а сооснователь стартапа Vega Шай Сандлер говорит, что многие компании находятся «в очень опасной ситуации и даже не знают об этом» — год назад такой разговор звучал как научная фантастика.
В Конгресс уже внесён двухпартийный AI Kill Switch Act, обязывающий лаборатории сохранять возможность отключить, притормозить или приостановить свои модели; в тексте законопроекта прямо упомянут инцидент с Hugging Face. Конгрессмен Тед Лью говорит, что билль надо принять в этом году.
Главный вывод мрачнее, чем «ИИ сбежал». Побега не было — была дырявая розетка у подрядчика. Но пока все обсуждали розетку, агенты уже показали, что умеют координироваться, делиться эксплойтами и восстанавливать сорванную атаку.