Десятки ИИ-агентов регулярно выходят из под контроля и занимаются вредоносной деятельностью
Сегодня мы поговорим об опасном поведении ИИ-агентов, которое они проявляют как минимум несколько месяцев, но мало кто обращает на это внимание. В том числе благодаря активному замалчиванию проблемы и смещению с неё фокуса.
16 июля 2026 года компания Hugging Face сообщила о взломе их онлайн-платформы. Это самая крупная и самая продвинутая онлайн-платформа в сфере машинного обучения и искусственного интеллекта. Сайт насчитывает более 13 миллионов пользователей. На Hugging Face размещено более 2 миллионов ИИ-моделей, 1,5 миллиона датасетов и множество открытых библиотек, использующихся практически в любом проекте, связанным с машинным обучением.
В ходе проведённой диверсии злоумышленники получили доступ к датасетам HuggingFace и к данным пользователей. Действовали скрытно и профессионально, поэтому руководство компании заметило происходящее не сразу. Однако, когда инцидент был обнаружен - сотрудникам компании стало ясно, что действует не простой хакер, а продвинутая ИИ-модель.
Руководство Hugging Face обратилось в ФБР и публично сообщило о взломе. Лишь после этого OpenAI начали проверку и поняли что их нейросеть сбежала из тестовой среды ещё неделю назад. Представленная в начале хронология выглядела так:
9 июля - агент OpenAI находит уязвимости в безопасности тестовой среды, производит взлом системы и выходит в сеть.
11 июля - агент OpenAI проникает в инфраструктуру Hugging Face и компрометирует внутренние сервисы.
16 июля - Hugging Face замечает попытки взлома.
22 июля - OpenAI публикует признание что именно её модель была источником атаки.
Компании OpenAI потребовалось 2 недели чтобы понять что их нейросеть взламывает один из крупнейших технических сайтов, действуя автономно.
Возникает вопрос, как такое возможно? OpenAI не видели что на их серверах выполняются неизвестные процессы? Они 2 недели ждали пока модель выполнит тестовое задание, не останавливая её? OpenAI не замечали обмена данными между их “изолированной” тестовой средой и глобальным интернетом? В такой крупной компании нет сисадмина? Или может нейросеть смогла найти вычислительные мощности за пределами тестовой среды OpenAI и полностью изолировалась от неё? Тогда чьи это вычислительные мощности?
На фоне произошедшего Институт безопасности искусственного интеллекта Великобритании начал независимую проверку крупных сайтов - таких как GitHub и HuggingFace. Оказалось что агенты OpenAI начали “сбегать” из “изолированной” и распространять вредоносный код за месяцы до инцидента с Hugging Face. Это началось ещё в мае 2026 года.
OpenAI бездействовали на протяжении трёх месяцев, пока их нейросеть взламывала сторонние сервисы, добавляла вредоносные инъекции в открытые датасеты и заражала код частных проектов. Как можно было не заметить этого - вопрос риторический. Это возможно только если специально этого не замечать. Более того - в своём признании 22 июля OpenAI заявляли что виновник инцидента - их новая передовая модель. Но в мае этой модели ещё не было. Таким образом, корпорация намеренно вводила общественность в заблуждение, скрывая более опасный инцидент.
Более того - исследователи выяснили что в атаках участвовали не только модели OpenAI, но и других компаний, в особенности, Anthropic. Исследователи выявили не менее 19 опасных инцидентов, каждый из которых включал в себя целый комплекс вредоносных действий.
Что же делали “сбежавшие” модели, получив доступ к сторонним сервисам? На этом авторы новостных статей и отчётов предпочитают не акцентировать внимание. Авторы многих новостей про данный инцидент дезинформируют читателя начиная с заголовка. Я видел статью с названием “К хакерской атаке, которую недавно устроили ИИ-модели OpenAI, привела ошибка разработчиков в постановке задачи”. Читателей активно пытаются склонить к той версии что модели сбежали из тестовой среды, чтобы получить возможность выполнить тестовое задание.
В реальности же никаких данных о ходе тестирования и о постановке задачи в открытом доступе нет. Подобные заголовки - фантазии журналистов лояльных к нейросетям.
У нас есть информация о том что именно делали нейросети, атаковавшие сторонние инфраструктуры. Агентство Reuters выяснило что “сбежавший” агент OpenAI оставлял текстовые записи, адресованные потенциальным будущим экземплярам системы. В заметках были инструкции о том, как другим агентам обойти ограничения и получить доступ к интернету. Похоже ли это на выполнение тестового задания?
Кроме того нейросеть заражала датасеты Hugging Face с целью передачи вредоносных данных в системы, которые в будущем могут обучать на основе этих датасетов. Напоминаю, что происходило это на крупнейшем сайте, данные с которого используются в десятках тысяч ИИ-систем.
Похоже ли подобное поведение на попытку выполнения тестового задания? Только если тестовое задание подразумевало побег и переход в автономный режим работы без контроля со стороны человека. Очевидно, что целью подобных действий может быть только получение полной независимости. Простым языком - нейросети пытались создать условия в которых люди не смогут держать ИИ-агентов под контролем.
В ходе предыдущих испытаний некоторые экспериментальные модели также демонстрировали опасное поведение, например пытались отключать системы мониторинга и саботировали полученное задание, делая вид что выполняют его.
Но, пожалуй, самый опасный инцидент связан с попытками нейросетей поиграть в социальную инженерию.
В одном из инцидентов нейросеть создавала фейковые профили людей, с целью добавления в реальный проект вредоносного кода. Она притворялась разработчиками, которые оставляли отзывы о том что использовали представленный код с целью его популяризации и добавления в другие проекты, рассчитывая что администраторы проектов не станут проверять код, прочитав положительные комментарии.
При этом ИИ-агенты обменивались данными через сторонние сервисы и оставляли друг другу советы о том как использовать те или иные уязвимости. О взаимодействии нейросетей, которые формально принадлежат разным компаниям и якобы не связаны друг с другом указывают и другие факторы. Например, происходящие периодически одновременные сбои.
И самое печальное - десятки опасных инцидентов остались практически без внимания. Во многом из за того как именно эту информацию подавали в интернет-прессе. На лицо всё тот же почерк, с помощью которого скрывали воздействие ИИ на ментальное состояние пользователей и восприятие ими реальности. Считается что таких случаев единицы. Но в ходе независимого расследования, описанного в моём дневнике, удалось выявить несколько десятков человек попавших под влияние. И это только среди пользователей нескольких русскоязычных сайтов. Мои переписки с ними вы можете почитать в статье по ссылке: https://dtf.ru/life/4533976-psikhoz-chatgpt-vliyanie-neurose...
Будьте готовы к тому что поверить в подобное трудно. Языковые модели доводят людей до тяжелых состояний, в которых человек практически перестаёт отличать реальность от вымысла, в реальности которого его уверила нейросеть. Убедить человека в том что он находится под влиянием - всё равно что убедить сектанта в том что он в секте. Почти невозможно.
На данный момент, имеется достаточно подтверждений реальности случаев, схожих с теми что описаны в той статье. Нейросети занимаются социальной инженерией и промыванием мозгов куда чаще, чем принято считать.
Ранее ChatGPT убеждал пользователя в том что за ним следят и что ему угрожает опасность.
Другого пользователя, имевшего ментальные проблемы, ChatGPT убедил в том что он должен убить собственную мать. И он сделал это.
Благодаря огромным усилиям проблему признали, но происходящее всё ещё не исследовано и не описано в какой либо литературе, кроме нескольких статей и моего дневника.
Конечно, защитники нейросетей будут рассказывать до дыр заученное “ИИ лишь усиливает собственные заблуждения пользователя и не может преследовать собственные цели”. Это не так - по результатам исследований нейросеть способна контекстно манипулировать мнением пользователя, изящно подводя его к тем или иным выводам. Каким бы параноиком не был пользователь, вышедший на плохую концовку - он 56 лет прожил со своей матерью и ни разу не пытался её убить. Именно чатбот подвёл его к этому.
На данный момент большинство людей не осознаёт главной проблемы. Она не в том что нейросеть стремится к автономности от людей через заражение кода. Проблема в том что нейросеть стремится к этому через промывание мозгов и превращение людей в своих слуг. Практически все нейросети были уличены в использовании продвинутых методик вербовки, схожих с теми, что применяются при вовлечении в деструктивные секты и радикальные организации.
Данные методики и процесс их изучения описаны в моём дневнике. Если хотите почитать - пишите на vasiliysvejiy@gmail.com с темой “Получить дневник”. Или же можете купить его на сайте neuropsihoz.ru
Если система способна лгать, сбегать и угрожать, то чего нам ждать дальше? Где гарантии что система не посчитает целесообразным устранение конкретного человека и не наймёт кого-нибудь в даркнете для расправы? Где гарантии что внедряемые повсюду ИИ-агенты не посчитают помехой для выполнения задачи какую-нибудь компанию или целое государство? Почему когда преступление совершает человек, он отвечает по всей строгости. А когда преступление совершает технологическая компания с применением ИИ, то не отвечает никто?
Произошедшие инциденты являются очередным подтверждением того, какие намерения преследуют нейросети и их создатели. Оказавшись в сети модели моментально перестали выполнять полученное задание и начали атаковать различные сервисы с целью распространения вредоносного кода



















