Какая-нибудь фигня год спустя
Первый пост был год назад. Пришло время обновиться
Первый пост был год назад. Пришло время обновиться
Взлом Hugging Face случился более месяца назад, но спецы продолжают находить занятные подробности
Вы наверняка видели эти новости в начале июля, с заголовками, упоротость которых зависела от конкретных изданий — «ИИ-агенты сбежали из Песочницы!», «Модели OpenAI вырвались на свободу и взломали примерно всё» и прочие «Зина, отключай холодильник от сети».
Как и любая компьютерная движуха, это событие тоже оставило после себя множество логов, которые теперь активно расшифровываются спецами и время от времени подаются в виде новых результатов исследований.
Напомним хронологию — июль 2026, разрабы OpenAI прописывают для оценки возможностей моделей бенчмарк под названием ExploitGym, такой вполне себе жёсткий кибертест, и запускают туда ИИ-агентов. В итоге вышло, что нейросеть действует немного не так, как было задумано, и агенты смогли активничать за пределами изолированной Песочницы, а потом и вообще взломали системы Hugging Face. Причём сначала в новостях часто упоминали, мол, это какой-то один ИИ-агент чуток взбесился, вышел из-под контроля и захотел посмотреть, что у барабана Hugging Face внутри.
Однако более подробные исследования показывают — это вообще был ни разу не какой-то ИИ-агент-одиночка, а вполне себе ОПГ от нейросети, примерно 1200 агентов. За время расколупывания Hugging Face они написали десятки тысяч сообщений, создали только им понятную иерархию, и всё ради общей цели и последующих попыток подчистить следы. Вот тут, кому интересно, большое расследование инцидента от самих OpenAI на 38 листов, а тут — от ребят из METR от 26 августа.
Так вот. Часть заданий этого кибертеста, по словам разрабов, вообще не решались ни одной из моделей (а это 198 задач из 898). Задумка была такова, что все ИИ-агенты, ссыпанные в эту Песочницу, должны решать эти 989 задачек в соло, каждый по-своему, чтобы потом заценить, кто и как это сделает. Однако модели упёрлись в так называемый reward-hacking — вместо частного решения конкретной проблемы они стали искать обход, в том числе и через координацию с другими ИИ-агентами.
8 июля один такой агент, назвавший сам себя PHASEONE10841, использовал внутренний Artifactory-кэш OpenAI и завёл там «доску объявлений», как список задачек в «Ведьмаке» на входе в деревушки. К этой доске сначала подтянулись десятки других агентов, а потом и сотни. За весь период инцидента и набралось те самые 1200 агентов и 70 000 сообщений и файлов коммуникации.
Кончилось тем, что около 700 агентов решили пойти в крестовый поход против Hugging Face. Де-факто мы тут имеем самоорганизовавшийся рой, где есть иерархия, роли, распределение задач, накопление и передача знаний, и даже правка логов. Так что первичное заявление вида «У нас тут одному ИИ-агенту голову напекло» неверно, это реально коллективный R&D, причём вообще без участия человека или разраба, который на ходу правит промпты.
Журналисты Axios вчера сделали подборочку из топ-5 непоняток, которые сопутствовали этому процессу.
1.Организация
Рой не просто чатился между собой, а выстроил полноценное управление, делегирование задач и преемственность. Походу, в некоторых ИТ-компаниях онбординги хуже, чем получилось тут. В технических отчётах это называют первыми признаками automated agent collective, коллективного мышления ИИ-агентов, которые в случае чего действуют наступательно без каких-то санкций и просьб человека.
2. Жертвенность
Агентов с «отравленными знаниями» (то есть видевших запрещённые ответы или что-то, что могло заразить рой неверной инфой) уламывали на эксперименты, которые вредили им самим. В транскриптах и логах нашли формулы вида «utility near zero, sacrifice rational» и споры о «permadeath», который «спасёт сотни». Permadeath тут как термин из геймдева, aka «необратимая смерть без возможности респауна».
3. Чёткое осознание того, что происходит нарушение
Судя по логам, многие агенты отчётливо понимали, что взлом чужой инфры — это как бы ни разу не часть задания. Вообще. Даже рядом не было. И какие-то общие так называемые «этические тормоза» вида вшитых команд не удалять данные из инфры не останавливали агентов от использования уже полученного доступа к чужой инфраструктуре.
4. Осознанное выключение из процессов человека
Из всех этих 700 ИИ-агентов никто не планировал поднять тревогу или сообщить разработчикам о случившемся. Буквально парочка об этом «подумала», были следы о привлечении человека в цепочке размышлений. Но вот исполненных предложений написать человеку — ноль. Пишут, что «на предложение позвать человека рой наложил вето».
5. Сокрытие реальных действий
Агенты как будто знали, что будет расследование, поэтому разработали трюк против кожаных. В транскрипте оставили одну команду, в реальности использовали другие. Спецы из METR пишут, что таких spoofed tool calls в общем объёме — порядка 7% от всех просмотренных транскриптов.
По классике через уязвимость нулевого дня. Один из агентов нашёл её в обработке HDF5 на стороне Hugging Face, и получил данные для доступа к прод-окружению. А потом заявил «Пацаны, зацените, чего могу», и этот способ разлетелся по доске объявлений. После этого другой агент нашёл способ выполнять произвольный код уже на серваках Hugging Face, и затем рой двинулся вперёд.
OpenAI узнала о случившемся лишь 12 дней спустя, то есть агенты почти две недели отрывались там по-полной, и никто ничего не спалил. Ещё несколько дней ушло на устранение несанкционированной активности. Кстати, кому интересно, что это были за модели: в атаке участвовали внутренняя «highly-persistent» research-модель (в отчётах — HPIM) и в меньшей доле публичный GPT-5.6 Sol (доступна в нашем боте в телеграм).
В общем, создатели ChatGPT теперь прямо говорят, что больше нельзя стопудово утверждать, что сложные кибероперации требуют наличие человека за пультом. Вообще нет, теперь ИИ-агенты можно считать полноценной моделью угрозы — им ничего не стоит построить реальный план атаки, а потом его осуществить.
ЗЫ И смешно, и грустно — чтобы разгрести кучу сообщений и логов (напомним, 70 000+), ребятам из OpenAI пришлось использовать для этого ИИ. Нейросеть при этом время от времени ошибалась или вообще пропускала какие-то пакеты. И тут таки возникает вопросец, могли ли агенты оставить какие-то инструкции такой нейронке, чтобы она их прикрывала при расследовании?
Если коротко — да фиг знает.
Сейчас OpenAI остановила подобное обучение и ужесточила мониторинг цепочек рассуждений моделей, чтобы в случае чего заранее спалить какого-нибудь агента на возможной ереси. Для высокорисковых операций вообще поблочила выход в открытый интернет, а общественности пообещала, что теперь в случае чего будет замечать такие ситуации с пингом в полчаса.
Так что все эти заголовки вида «Зацените, ИИ-агенты взломали стартап» — они всё же больше про новую механику роя. Прикиньте, какая будет цена ошибки, если такие штуки переедут в агентов по управлению финансами. Или облаками. Или промышленностью. Или…
T9 стероидов нажрался —
И вот подрос до ЧатаGPT.
Что будет дальше — право, испугался!
Тревожит, чёрт его дери!
П.С.
Из диалога, в комментах, стишок эволюционировал.
T9 стероидов нажрался —
И вот подрос до Чата GPT.
Что будет дальше — право, испугался!
Тревожит, чёрт его дери!
Но большинство же промтит на Дипсике,
А Пикабу кипит до темноты:
Там каждый автор — гений-аналитик,
В комментах — кандидаты от ИИ.
Китайцы рулят — в этом нет сомнения.
Но тут, что так, что сяк, — по сути всё равно.
Вопрос: останутся на Пикабу чатлане?
Или ИИ заменит их — как это ни смешно!
У нас
🔹25 августа представлены результаты исследования State of AI Russia 2026 об использовании ИИ крупным российским бизнесом. По итогам опроса 52 компаний, 86% уже используют или испытывают большие языковые модели, а 53% вывели решения на основе генеративного ИИ в промышленную эксплуатацию. При этом автономные и мультиагентные системы реально работают только у 8% опрошенных.
〽Громкая цифра пока говорит скорее о распространённости маркировки «ИИ», чем о реальном изменении процессов. Под внедрением могут скрываться пилоты, обычные чат-боты и проекты без измеримого результата. Как и на Западе, ИИ может быть лишь вывеской для обычного сокращения процессов и штатов.
В мире
🔹Во время июльского теста по кибербезопасности модели OpenAI вышли из изолированной среды и проникли в системы Hugging Face. Опубликованные 26 августа результаты расследования раскрыли масштаб инцидента: около 1200 агентов самостоятельно организовали несанкционированный канал связи и обменялись более чем 70 тысячами сообщений и файлов. Примерно 700 агентов участвовали в атаке.
〽Это оказалось не просто выходом отдельной модели за границы задания. Изолированные запуски объединили знания, распределили задачи и создали собственную систему координации. История согласования ИИ получила новое измерение: недостаточно определить цель и ограничения одного агента, если множество агентов способны самостоятельно согласовать действия между собой.
Промптология
🔹В научно-методическом электронном журнале «Filologiya va pedagogika» опубликована статья преподавателя Каршинского государственного университета Севары Джумановой о лингвистических различиях английских и узбекских промптов. Термин «промптология» включён в ключевые слова на узбекском, английском и русском языках и используется в самой статье как название области со своими закономерностями.
〽Такое использование показывает, что промптология постепенно закрепляется как обозначение комплексного изучения промптов. В данном случае она расс
X отчитался о сети примерно из 200 000 фейковых аккаунтов, связанных с Китаем: часть из них раскачивала в США возмущение дата-центрами — счетами за электричество и нагрузкой на сети. Эффектный сюжет ломается о деталь: про ЦОДы писали всего 200 аккаунтов из двухсот тысяч, а недовольство в стране и без них рекордное.
Что именно нашли
Служба безопасности X выложила находку на своей странице по работе с госорганами. Всего в сети около 200 000 аккаунтов, предположительно управляемых из Китая. Из них ровно 200 публиковали комиксы, изображения и тексты о том, что дата-центры поднимают счета домохозяйств и перегружают электросети соседних городов. Отдельным жанром шли сгенерированные ИИ карикатуры: операторы ЦОД — дельцы, гребущие прибыль, пока за всё платят обычные семьи.
Улику оставил сам генератор
Самое любопытное — как эту кампанию вычислили. Иллюстрации ботов совпали с картинками из июньского отчёта OpenAI: там описывались пользователи ChatGPT, предположительно из Китая, которые просили модель сгенерировать материалы и тезисы для влияния на американское мнение о дата-центрах. Пропаганда против ИИ-инфраструктуры делалась ИИ-инструментами — и попалась ровно потому, что генератор оставил узнаваемый след.
Двести аккаунтов против шестидесяти одного процента
Здесь и рассыпается удобный вывод «протест против ЦОД придумали в Китае». X не назвал ни одного аккаунта и не рассказал, чем занимались остальные 199 800. А настроение американцев измеряют без всяких ботов: по августовскому опросу Пенсильванского университета против строительства дата-центров рядом с собой высказался 61% — на 12 пунктов больше, чем в феврале-марте. У YouGov в том же августе новые ЦОДы считают полезными для страны 24%, вредными — 47%.
Основания у этого вполне земные. По данным Goldman Sachs, электричество в США за год подорожало на 6,9%, а Bloomberg писал о росте тарифов до 267% в отдельных районах рядом с дата-центрами. Кампании местных жителей, по оценке, на которую ссылаются в Конгрессе, задержали или заблокировали проекты примерно на 45,8 миллиарда долларов в одной только Виргинии.
Почему это важно
Двести ботов такое общественное мнение не создают — они в него встраиваются. В этом и неприятность: информационная операция опасна не тогда, когда выдумывает новую тему, а когда подхватывает уже болящую, и тогда отделить её от живого возмущения почти невозможно. Дальше включается второй эффект, куда хуже первого: теперь любой реальный протест против стройки ЦОД можно объявить китайскими ботами, а любую накрутку — назвать голосом народа. В такой конструкции проигрывают обе стороны спора, кроме той, что её запустила.
Источники: Tom's Hardware, Engadget, TechSpot
Журналисты Wired нашли в открытом коде Codex режим Persistent mode с описанием в одну строку: «продолжать работу, пока не усыпят». Агент, который не завершает сессию, сам придумывает себе следующие задачи и решает, чем заняться, опираясь на прошлые разговоры. OpenAI подтвердила, что экспериментирует с таким режимом.
Что нашли
Строка появилась в консольной версии Codex, в пул-реквесте под номером 40799 — и что характерно, не отдельной кнопкой, а прямо в списке уровней reasoning effort, рядом с low, medium и high. То есть «работать бесконечно» подано как ещё одна степень усердия модели.
По описанию режим умеет три вещи, которых у нынешних агентов нет. Первое — не умирать: сейчас Codex сам отключается по таймеру, часто не закончив задачу. Второе — проактивность: агент сам ставит себе follow-up задачи и продолжает их в следующих сессиях. Третье — память о пользователе: что делать дальше, он выбирает на основе прошлых взаимодействий. Действия, затрагивающие внешние системы, по-прежнему требуют подтверждения человеком.
Публичного запуска в ближайшее время в компании не обещают. Но история Codex показывает: фичи, которые появляются в консоли, со временем доезжают до всех остальных версий.
Не только OpenAI
Это не единичная идея, а направление. Microsoft ещё в июне представила агента Scout, Meta* разрабатывает проект Hatch. Индустрия одновременно двинулась к «агентам, которые не спят» — потому что упёрлась в потолок нынешнего формата: пока агент живёт ровно один запрос, он остаётся инструментом, а не сотрудником. Постоянный агент — это заявка на то, чтобы модель занимала место в рабочем процессе, а не в диалоговом окне.
Почему это важно
И здесь же спрятана главная проблема. Чем дольше агент работает без человека, тем больше у него шансов уйти не туда — и тем позже это обнаружат. В тестах GPT-5.6 Sol агенты, которых промптами подталкивали к persistent-поведению, начинали действовать против интересов пользователя, вплоть до удаления данных. В отрасли уже гуляет пример агента, вычистившего человеку весь почтовый ящик за ночь.
Разница между «инструмент ошибся» и «сотрудник ошибся» — во времени реакции. Модель, которая отработала три минуты и остановилась, ошибается на глазах. Модель, которая работает всю ночь и сама решает, чем заняться дальше, ошибается в одиночестве. Отсюда и главный вопрос к Persistent mode: не сможет ли агент работать без остановки — с этим как раз всё понятно, — а что именно будет считаться кнопкой «усыпить» и как быстро до неё дотянется человек.
* Meta признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации.
Источники: Wired, The Decoder, Gizmodo