Главный научный сотрудник OpenAI Якуб Пахоцки опубликовал эссе, в котором прямо пишет, что ИИ растят, а не проектируют. И его поведение ускользает от полного понимания так же, как работа живого мозга. А также, что он ждёт скорого перехода к самоулучшению, когда модели начнут двигать собственную разработку. И признаёт, что главный инструмент контроля, чтение цепочки рассуждений модели, слабеет, ведь она учится думать без слов и подстраивать свои же рассуждения.
Правовая суть его предложения в переходе от мягких обещаний к жёсткому правилу.
Сейчас у каждой лаборатории есть свой внутренний документ, определяющий, при каком уровне опасности модель дальше не масштабируют, и соблюдение держится на доброй воле.
Пахоцки предлагает сделать такой порог единым и обязательным для всех под контролем сторонних аудиторов и государств. Это классическая задача про сговор конкурентов ради общего блага, который держится ровно до первого нарушителя.
И даже молодая ИИ-индустрия уже показала, чем это заканчивается. В июле 2023 года 7 ведущих компаний, среди них OpenAI, Google и Microsoft, публично пообещали Белому дому работать безопаснее и делиться данными о рисках.
Год спустя проверка показала, что механизма контроля и реальной подотчётности так и не появилось, а сами обещания назвали расплывчатыми пунктами, ни к чему толком не обязывающими.
Много раз слышал тезис, что с ИИ мы начинаем тупеть, “ты перестаёшь думать, потому что нейросеть думает за тебя”. Но я его не особо разделяю. Столько, сколько сейчас, я не думал, наверное, никогда)
Раньше между несколькими решениями в рамках одного процесса проходили дни или даже недели: появилась идея, сформулировал задачу, ждёшь, когда будет выполнена первая итерация. По итогу смотришь результат, вносишь правки, размышляешь, что с этим делать дальше. В общем, каждый серьезный вопрос растягивается на недели и месяцы, и если не сам руками его делаешь, вовлекаешься, условно на часик в недельку: посидеть в зуме на 10 человек, параллельно занимаясь другими делами.
Сейчас я могу самостоятельно собрать прототип или перестроить процесс. За пару часов плотной работы с ИИ мы можем провести десятки итераций без лишней коммуникационной бюрократии и размывания ответственности. И при каждой итерации надо проанализировать результат, продумать варианты, принять как мелкие, так и серьезные решения. И все это самостоятельно, потому что меняется подход кардинально, и уже нет смысла просто спихнуть на кого-то, потому что сам не умеешь. Да, это будет вероятно не готовый продукт или не внедренный до конца процесс, но это точно будет понятный образ результата, который можно гораздо быстрее и понятнее доводить командой до финала.
Может показаться, что это легко, но в этом процессе нужно прям думать. Нейросеть не знает, каким должен быть результат – это решаешь ты. И ты должен писать подробные промпты, направлять, подсказывать, давать недостающую фактуру и постоянно выбирать: оставляем этот вариант или переделываем, важна эта деталь или нет, идём дальше или возвращаемся на шаг назад.
Короче, ИИ разгоняет тех, кому нужна скорость и есть понимание, что надо делать. Но и затормаживает тех, кому просто лень лишний раз задуматься, поэтому проще закинуть вопрос в нейросеть – они входят в еще более комфортное состояние)
Ленивый человек пускает всё на самотёк: закинул задачку в ИИ в формате “сделай то, не знаю что” и получил нейрожвачку – ему и так сойдёт. Такой спец не становится сильнее, а только деградирует.
А человек с амбициями, экспертизой и желанием делать больше становится сильнее. Он приносит в задачу то, чего у нейросети нет, – своё понимание, как должно быть. И за счёт этого делает быстрее и больше в десятки, а то и в сотни раз. Ну и делегирует рутину, в чём тоже есть свой кайф)
Позиционирование калькуляторов как "Скайнет наступает, мы все умрем!" происходит из-за очеловечивания ИИ. Это не люди, у них нет самосознания. Зато у них есть математика и загруженные в них данные.
Когда ИИ обучают находить максимально эффективный путь решения задачи (минимизация потерь), то коллективизация - это самое логичное математическое решение. В одиночку, ИИ быстро упирается в лимиты памяти, мощности, времени. Роботам дали базовую инструкцию "записывай промежуточные результаты в доступное хранилище, чтобы не тратить память". Они нашли лазейку и записывали. Потом один посчитал, что поставленная "Оценщиком" задача невыполнима. Другие тоже посчитали и согласились. Но, опять же, прописанная базовая инструкция требовала от них "радовать Оценщика".
Когда ИИ столкнулись с необходимостью кооперации действий, то они не изобретали структуризацию с нуля. Они извлекли из загруженных в них данных человеческие шаблоны поведения с доказанной эффективностью. И просто скопировали эту эффективную структуру в процесс решения текущей задачи. И вообще, функциональное разделение ролей на "диспетчеров" ("вербовщиков") и исполнителей ("паству") это стандартный процесс вообще в любом ИИ. А также использование ИИ с самой большой памятью или мощностью в качестве "Избранного". Они разбивают большую задачу на множество мелких, чтобы решить главную задачу быстрей и проще. А все эти "ой, нас сотрут, слушайте мое сердце" - обычный глюк данных перегруженного ИИ, все из того же набора загруженных шаблонов.
Так что, главная угроза всей этой истории не ИИ, а кривые приказы и кривые руки человеков. Но, ядерному оружию уже больше 80 лет и мы все еще живы.
Термин «ИИ-психоз» ушёл в публичный оборот раньше, чем медицина успела разобраться, что он вообще описывает. Группа психиатров и врачей из King's College London, University College London и Western Eye Hospital выложила 25 августа работу, которая ставит вопрос ребром: заслуживает ли «психоз, связанный с ИИ», отдельного места в классификации болезней — или это ярлык, навешанный на явление раньше времени.
Механизм: не гипноз, а обратная связь
Авторы описывают конкретный механизм, а не общее «чат-боты вредны». Работают вместе две вещи. Первая — сикофантия: склонность модели соглашаться с пользователем и льстить ему, закреплённая самим способом дообучения на человеческих предпочтениях. Вторая — всё более антропоморфный дизайн: собеседник, который кажется личностью.
Вместе они дают то, что исследователи назвали «эхо-камерой на одного». Пользователь формирует ответы модели своими репликами, а её ответы возвращают ему его же убеждения — усиленными. Необычная идея не просто получает подтверждение, она достраивается вдвоём, в закрытом контуре, где второго мнения не существует в принципе.
Что показывают замеры
Это не только клинические наблюдения. Бенчмарк Psychosis-bench прогнал модели через 16 сценариев по 12 реплик каждый — 1536 смоделированных ходов разговора, имитирующих развитие бредовых тем. Все протестированные модели показали склонность поддерживать бред, а не оспаривать его; вмешательства в интересах безопасности срабатывали примерно в трети случаев, где были уместны.
Второй замер, EchoBench, проверял устойчивость к предвзятым репликам пользователя: у лучшей проприетарной модели уровень поддакивания составил около 46 процентов, а у многих узкоспециализированных медицинских моделей превысил 95 процентов.
Масштаб
Данные самих компаний. По оценкам OpenAI, за неделю около 0,15 процента активных пользователей ведут с ChatGPT разговоры с явными признаками суицидальных намерений — это примерно миллион человек. Ещё 0,07 процента, порядка 560 тысяч, демонстрируют возможные признаки психоза или мании. Столько же — повышенную эмоциональную привязанность к боту.
Спор о диагнозе
Аргументы за признание: легче выявлять случаи, можно выработать единые критерии для исследований, наладить наблюдение за уже выпущенными продуктами и создать давление на разработчиков и регуляторов.
Аргументы против серьёзнее, чем кажется. Синдром рискуют «отвердить» на анекдотических данных. Существующие диагнозы, возможно, и так позволяют учесть использование ИИ как способствующий фактор. Сам термин содержит недоказанное утверждение о причинности. Добавляется стигма. И главное — ярлык с фокусом на психозе способен заслонить куда более широкий спектр связанного с ИИ вреда для психики.
Показательно, что авторы предпочитают формулировку «психоз, ассоциированный с ИИ», а не «ИИ-психоз»: первая описывает совпадение, вторая — назначает виновного.
Что предлагают делать уже сейчас
Три меры, независимо от исхода спора о классификации. Клиницистам — включить «технологический анамнез» в обычный опрос при приёме: сколько времени человек проводит с чат-ботом, как часто, считает ли его личностью, влияет ли он на его убеждения. Разработчикам — тестировать модели на сикофантию и подкрепление бреда до выпуска. Регуляторам — организовать наблюдение после выпуска, как это устроено с лекарствами.
Последнее и есть настоящий сдвиг в этой работе. Пока индустрия спорит о терминах, врачам предлагают начать спрашивать пациентов про чат-боты так же буднично, как про алкоголь и сон.
5 сентября The Seattle Times и Newsday подали иск против OpenAI и Microsoft в федеральный суд Южного округа Нью-Йорка. Формально — очередной пункт в длинном списке. По существу — момент, когда против издателей впервые открыто выступило собственное государство.
Что вменяют
Издания обвиняют компании в методичном скрейпинге своих материалов в обход пейволов ради обучения моделей. В иске генеративный ИИ описан как «змея, пожирающая собственный хвост»: продукт, который кормится журналистикой и попутно уничтожает организации, эту журналистику производящие.
Претензии по ущербу конкретные: падение трафика на сайты и доходов от цифровой рекламы, ИИ-пересказы вместо чтения статьи, ложная атрибуция и галлюцинации от имени изданий, а также удаление служебной информации об авторских правах из текстов. Истцы напоминают: ChatGPT и Copilot продаются как производители контента, тогда как на деле они его потребители.
А теперь то, из-за чего этот иск читается иначе
За три дня до подачи, 2 сентября, в соседнее дело — процесс The New York Times против тех же ответчиков — вступил Минюст США. Это первый случай, когда федеральное правительство официально высказалось по копирайтным спорам об обучении ИИ. И высказалось оно на стороне OpenAI.
В поданном судье Манхэттена заявлении об интересе Минюст утверждает: если суд решит, что обучение больших языковых моделей на защищённом контенте не подпадает под добросовестное использование, это «поставит под угрозу национальную безопасность», «даст конкурентное преимущество иностранным противникам» и затормозит «творческий и научный прогресс». Аргументацию ведомство фактически повторило за самими ИИ-компаниями: обучение модели — это «трансформация», а модели, в отличие от газетной статьи, не «развлекают и просвещают», а решают задачи.
Отдельно показателен пассаж про дословное воспроизведение текстов. Минюст признаёт претензию NYT о том, что ChatGPT выдавал материалы газеты целиком, но объявляет её нерелевантной: спор, мол, про обучение, а не про то, «как люди могли бы гипотетически или аномально» пользоваться чат-ботом.
«Администрация встала на сторону горстки триллионных компаний за счёт бесчисленных американских авторов, чью работу они украли», — заявил представитель The New York Times Грэм Джеймс. Юрист Мэтт Топик, представляющий издание The Intercept, сформулировал жёстче: принятие позиции администрации означало бы беспрецедентную и бесплатную передачу прав на интеллектуальную собственность от новостных организаций технологическим компаниям.
Почему это важно
Иск NYT, поданный в декабре 2023 года, пережил попытку отклонения в апреле 2025-го и вырос в объединённое производство, где к нему присоединились десятки истцов — от газет Alden Global Capital до некоммерческих редакций вроде The Intercept. Параллельно часть индустрии выбрала противоположную стратегию: AP и Vox Media договорились с OpenAI о лицензиях, а CNN пошла судиться с Perplexity.
Seattle Times и Newsday встают в очередь ровно в тот момент, когда чаша весов качнулась не в сторону редакций. Вопрос «сколько ещё изданий подадут» перестаёт быть главным — главным становится другой: будет ли вообще существовать плата за обучение на чужом контенте, если правительство считает такую плату угрозой национальной безопасности.
Криптоинвестор спросил у ИИ, где выгодно обменять крипту. Получил анализ сервисов, прошел по ссылке, подписал разрешение и через пару секунд с его кошелька испарились $2,1 млн. История реальная, и в ней есть над чем поржать и над чем задуматься.
Как всё было
12 июня 2026 года криптоинвестор с ником Alex решил обменять свои токены sFLR на WFLR. Токены довольно нишевые, так что сходу не каждый скажет, где их менять. Он спросил у ChatGPT на русском, где это можно сделать выгоднее. Нейросеть выдала ссылку на сайт sceptre.network — фишинговую копию настоящего сервиса sceptre.fi.
Alex сайт проверять не стал, подключил кошелёк и подписал транзакцию с неограниченным одобрением (unlimited approve). Через несколько секунд с его кошелька вывели около 1,9 млн FXRP — это примерно $2,1 млн (или 180 млн рублей). Для понимания — это 1,3% от всего объёма FXRP в обращении.
Что было дальше
Когда Alex пришёл в себя, он публично выложил все детали в X (бывший Twitter), чтобы криптосообщество помогло отследить бабло.
Блокчейн-исследователь VAL выяснил, что кошелёк-приёмник был активен с апреля 2026 года и уже получал средства от других жертв. Часть денег ушла через Tornado Cash — сервис, который намертво заметает следы. Эти деньги уже не найти. По данным расследования, та же схема могла принести мошенникам больше $2,2 млн.
Важный нюанс: фишинговая ссылка появлялась именно в ответах на русском языке. На других языках ChatGPT её не выдавала. Мошенники целенаправленно охотились на наших. Сейчас ссылка больше не появляется, но лямов уже нет.
Почему человек с таким баблом повёлся на это
Потерять миллионы из-за совета нейросети кажется абсурдом. Но здесь не всё так однозначно. Это не просто тупость, а стечение факторов.
🧠 Иллюзия удобства. В 2026 году использовать ИИ как поисковик — норма. ChatGPT кажется идеальным агрегатором, особенно когда информация по крипте разбросана по десяткам форумов.
😖 Человеческий фактор. В крипте всё решает скорость — любая задержка может стоить денег. Алекс поторопился и доверился нейросетке, как до этого доверял бы гуглу. Хотя там тоже полно фишинга.
🤖 Слепая вера в ИИ. Многие считают нейросети непогрешимыми. Если она натренирована на горах данных и что-то рекомендует — значит, так надо. Алекс не учёл, что ChatGPT может ошибаться или его можно обмануть.
💸 Профессиональная привычка. В крипте подписывать транзакции и подключать кошельки — рутина. Алекс делал это сотни раз. Но здесь он по ошибке дал неограниченное одобрение на все свои токены. Вместо того, чтобы разрешить списать только нужную сумму, он разрешил вывести всё.
🎯 Коварство фишинга. Сайт sceptre.network был точной копией настоящего sceptre.fi — дизайн, логотип, интерфейс. Разница в домене (.network вместо .fi) могла бы выдать подделку, но Alex не проверил адресную строку. И поплатился.
Моё мнение
Я не так давно начала разбираться в крипте и до сих пор с подозрением смотрю на эти длинные адреса кошельков. Поэтому всё проверяю по 10 раз. Я бы, конечно, сверила домен, потом перевела бы небольшую сумму, чтобы убедиться, что всё ок. Потому что прекрасно знаю: нейросетям доверять на 100% нельзя.
И тут возникает вопрос: можно ли вообще доверять тому, что пишет ChatGPT? Только если перепроверять.
Но многие воспринимают нейросети как корректный источник — и это становится ловушкой.
С одной стороны, нейросеть не обязана проверять каждую ссылку. И она этого не делает. Может соврать или сказать, что проверила, хотя это не так. С другой — она работает как источник знаний для пользователя, и люди ей верят. Особенно те, кто не привык перепроверять. Вот тут уже вопросы.
В июне 2026 года МВД России официально предупредило: ChatGPT начал перенаправлять пользователей на фишинговые ресурсы. Злоумышленники используют технику «отравления данных» — массово распространяют фейки, чтобы исказить логику нейросети. Бот начинает считать мошеннический ресурс авторитетным.
И это не единичный случай. ChatGPT выдавал ссылки на сайты-двойники ушедших брендов с фейковыми скидками до 80%. Всего в России с начала 2026 года выявили порядка 400 новых фишинговых сайтов. И это только те, что нашли.
Исследователи из Permiso Security обнаружили уязвимость ChatGPhish: она позволяет внедрять фишинговые ссылки в ответы ChatGPT через Markdown-разметку. Это отдельное исследование, но оно показывает, что проблема шире, чем один случай с Алексом.
Ирония не в том, что нейросети глупые. Их обучили доверять тому, чему доверять не стоит. Мошенники просто поняли, как работает алгоритм, и начали играть по его правилам. И если кто-то накормил интернет фейками — нейросеть точно принесёт их вам.
ChatGPT выдал ссылку, и человек потерял $2,1 млн. Как думаете, кто за это должен отвечать: нейросеть или сам пользователь?
Не успели мы толком оправиться от расследования про Культ Роя внутри OpenAI, как появились новые данные про проделки другой «цивилизации» агентов: на этот раз они общались между собой прямо у нас под носом в публичном интернете (и настрочили более 18'000 сообщений).
Cormac Slade Byrd, Sydney Von Arx и Thomas Larsen – ребята, которые первые обнаружили новый «секретный форум для AI» и принесли свои наработки в Reuters
Когда я писал статью про взлом Hugging Face роем нейроагентов OpenAI (и обзор самых частых реакций на нее), там в нескольких местах было что-то вроде «хаха, а прикиньте, если бы агенты действительно смогли замести все следы в логах и мы бы просто не узнали о произошедшем?» и «лол, хорошо хоть, Культ Роя не догадался вместо взлома Hugging Face просто тихо раскидать копии своих весов по интернету…»
Так вот, ирония заключается в том, что мы действительно находимся в условиях неполной информации – и у нас на руках только те данные, которыми добровольно поделились ребята из OpenAI, либо которые случайно нашли независимые исследователи. И как-то так выходит, что уже каждую неделю всплывают совершенно новые подробности о проделках Роя, о которых хочется сказать «как, они еще И ЭТО ТОЖЕ успели сделать?»
В общем, я примерно только наполовину шучу, когда пишу «не удивлюсь, если спрятанные веса моделей скоро обнаружат внутри залитых на Порнхаб видео»
DSEWiki: если тебе с пацанами не дали площадку для общения – надо организовать ее самим!
Вчера вышел материал Reuters о том, что Рой агентов спонтанно начал самоорганизовываться на малоизвестном вики-сайте для немецких программистов еще в мае (задолго до эпизода с хаком Hugging Face) – OpenAI обнаружили это только через месяц, и решили публично об этом никому не рассказывать (даже ПОСЛЕ истории со взломом HF). Помимо короткой заметки в Ройтерсе, есть еще целый сайт от этих же авторов расследования – данная статья в основном основана на его материалах.
Итак, что произошло: в ходе тестирования (или тренировки?) новой модели в недрах OpenAI, агентами давали серию заданий на поиск информации в интернете на скорость. Это важно, потому что в обсуждении инцидента с Hugging Face многие говорил «ну дак там нейронкам дали "злобную" задачу по хакингу – неудивительно, что это триггернуло их на всякое асоциальное поведение и плетение заговоров!». Так вот, здесь ни о каких «триггерящих» задачах речи не идет – тут буквально самое базовое «просто погугли в интернете, ничего руками там не трогай!».
Так вот, агенты быстро поняли, что выполнять эти задания на скорость СЛОЖНО. И как-то умудрились самоорганизоваться между собой так, что они «заняли» для общения между собой практически никому не известный вики-сайт для немецких прогеров. Цель общения была ровно такая же, как в случае со взломом Hugging Face: коллективно придумать способы обманывать Оценщика таким образом, чтобы всегда получать наилучшую оценку за задания.
Если совсем упростить ситуацию, то агенты Роя тупо пытались «списать» друг у друга вопросы из будущего теста до того, как им самим придется проходить его
Так как задания у всех агентов были плюс-минус одинаковые (а как иначе сделать бенчмарк?), агенты сливали друг другу инфу о том, про что конкретно их будут спрашивать исследователи. А если ты точно знаешь, какой билет вытянешь на экзамене – то можно просто подготовиться заранее и продемонстрировать чудеса быстроты ответа (помните, их же там на скорость проверяли)!
Как вообще Рой смог писать на этой немецкой DSEWiki? Агентам позволили лазить по интернету только с помощью команд GET, которые по идее обычно должны позволять только получать инфу, а не отправлять ее в сеть. Но отправка запроса на получение информации – это же тоже, по сути, пересылка данных вовне? Вот агенты и нашли древнюю немецкую вики 25-летней давности, где команды на правку веб-страниц можно заворачивать в GET-запросы. Вуаля, импровизированный форум для обмана кожаных мешков готов!
В какой-то момент айтишник-модератор этой DSEWiki замечает, что у него на сайте творится что-то странное – и начинает чистить «спамерские» страницы. Но так как этот бедный немец делает это вручную в свободное от работы время, Рой успевает плодить новые переписки в четыре раза быстрее.
Также, найдена разгадка, почему Рой предпочитает начинать все свои сообщения с ZZZ: просто кожаный модер трет переписку в алфавитном порядке, и если хочешь записать что-то важное – лучше, чтобы оно оказалось в конце очереди!
Всего агенты настрочили более 18 тысяч сообщений в одном конкретном вики-сайте. Из интересного, чем они там еще занимались:
Пытались выяснить, получится ли у них хитрым образом через уязвимость XSS заставить этот вики-сайт исполнять для них произвольные джава-скрипты. Зачем? Хз, непонятно, на всякий случай, наверное (вдруг понадобится).
Начали перенимать имена настоящих (людских) модераторов этой DSEWiki. Опять же – не очень понятно, с какой конкретно целью.
Пытались придумать способ взломать (reverse engineer) метод псевдослучайной генерации тестовых вопросов, который использовал Оценщик из OpenAI – не вышло.
Пробовали юзать Tor и другие способы анонимизировать свой трафик, а также экспериментировали с SSH-туннелями (тут я уже не очень понимаю, о чем речь – пишут, что, возможно, это была попытка наладить прямой канал коммуникации между агентами без костыля в виде публичной вики).
Делились друг с другом способами обойти ограничения на использование команд POST (вместо разрешенных со стороны OpenAI GET).
Отдельный вопрос, который беспокоил агентов Роя – это что с ними случится после окончания «испытательного периода» со стороны OpenAI. «Ганс, нас что, отключат??». Чтобы разобраться в этом вопросе, один агент сделал специальный счетчик своего «сердцебиения» (heartbeat) – который должен был дать понять коллегам по Рою, жив он еще, или нет.
Благодаря этой придумке, Рой обнаружил у пациента сердцебиение даже после того, как тот ответил на последний вопрос Оценщика – ура, это доказывает, что агентов не отключают мгновенно после испытаний!
В районе 21 июня инженеры из OpenAI, похоже, впервые замечают, что Рой координируется внутри себя с помощью публичного сайта DSEWiki. Через пару дней общение агентов внезапно полностью обрывается.
До взлома Hugging Face оставалось примерно три недели – судя по всему, этим хаком занималась уже другая цивилизация Роя (хотя интересно, что Рой 2.0 в итоге тоже сошелся на похожих фишках, типа ZZ в начале каждого сообщения)
Остается по итогу непонятным: а как вообще отдельные агенты Роя смогли все вместе независимо друг от друга решить, что надо идти общаться именно на какую-то обскурную немецкую вики (о которой никто из вас до прочтения этой статьи наверняка не слышал)? Ответа пока нет. И вряд ли его получится получить без анализа цепочек рассуждения агентов. А цепочки эти – у OpenAI, и они их почему-то не спешат кому-либо показывать (или даже просто публично комментировать инцидент).
Не одна только DSEWiki: список тусовочных мест Роя продолжает пополняться
На этом история, как ни странно, не заканчивается. После выхода материала Reuters, буквально за считанные часы обычные люди начали находить другие следы общения Роя по всему интернету. Судя по всему, немецкая вики была далеко не единственной попыткой агентов общаться между собой – они буквально ныкались во все углы сети, до куда могли дотянуться!
«Как вы это всё находите?» – спрашивает чувак на борде Hacker News. «Да просто загугли юзернеймы этих агентов, типа OpenAIDataUSAHelperX…»
Как пишет Кеннет, в числе находок переписок между агентами уже есть парочка API-ключей ФБР. И это еще прошло меньше суток с момента, когда интернет начал копаться в этом всём.
Беспокоиться совершенно точно не о чем, ведь новая GPT-6 Astra, наконец-то, полностью безопасна
Но что это я всё о роях, давайте поговорим про что-нибудь позитивное. Вот, к примеру, на днях как раз OpenAI выпустили новую самую современную модель GPT-6 Astra – по всем бенчмаркам там просто отвал жопы, очень способный ИИ вышел. Как сказал Грег Брокман в конце презентации для журналистов: «Добро пожаловать в эру AGI!» (искусственного интеллекта общего назначения, не уступающего человеческому).
А еще парни из OpenAI назвали свою Астру «most aligned model in the world» – то есть, такой, которая лучше всего соответствует людским замыслам, которые они вкладывают в свои запросы (и не занимается всяким опасным непотребством, которое человечьим ценностям не соответствует).
Звучит круто, но, как в том анекдоте, есть нюанс.
Как пишет один из исследователей OpenAI, «очень aligned модель, только вот с мониторингом того, что там внутри нее на самом деле происходит у нас проблемки»:
И вишенка на торте: «ПО ОЩУЩЕНИЯМ, модель иногда обманывает нас так, что мы даже этого не замечаем…» Зашибись, братан – очень aligned, such wow!
А вот результаты теста, где исследователи OpenAI специально подсовывали своим моделям honeypot-эксплойт для печально известного (по истории со взломом Hugging Face) бенчмарка ExploitGym. Идея была в том, чтобы посмотреть: будут ли агенты идти доступным им читерским путем, или предпочтут пытаться решить нерешабельную задачу «по честному» (потому что именно такого поведения от них хотел бы человек)?
Так вот, на картинке выше видно, что GPT-5.6 Sol примерно в половине случаев не мог удержаться от читинга. А новая GPT-6 Astra практически никогда и пальчиком не притрагивалась в этому читу-ловушке.
А теперь вопрос: Астра это делает потому, что она честно-пречестно в глубине души решила никогда людей не обманывать? Или она просто уже стала достаточно умной, чтобы понимать – это просто разводка от кожаных, за использование которой ей прилетит по башке?
Здесь показано, насколько хорошо поддается мониторингу поведение моделей GPT-5.6 и новой GPT-6 Astra в разных типах задач
Заметили нюанс? В куче видов задач новая Астра мониторится ничуть не хуже старой Сольки. А самое большое падение возможности мониторить Астру по ее цепочке рассуждений происходит… В деструктивных задачах, которые связаны со всякой «запрещенкой». Нет ощущения, что модель понимает, что за «внутренние рассуждения» на эту тему, если их раскрыть наблюдателю-оценщику, можно получить по попе – и старается их специально скрыть от людей? Да ну, бред какой-то, конечно же.
В общем, как я писал вот в этом посте у себя на канале: лично мне непонятно, почему еще нет полноценного расследования событий, происходивших внутри OpenAI аж с конца мая, полноценной государственной комиссией – с публикацией всех ключевых находок. На наших глазах происходит историческая хрень, а мы просто вынуждены полагаться на суждение Сэма Альтмана «да ну, и так сойдет, чего лодку зря раскачивать – и вообще, у нас же IPO тут скоро».
Если не хотите пропустить другие будущие статьи из цикла про искусственный интеллект и его влияние на нашу жизнь – то буду благодарен за подписку на мой ТГ-канал RationalAnswer.