У меня ДЦП. Речь искажённая. Я хожу в голосовой ввод трёх топовых мировых нейросетей — ChatGPT, Claude и Grok — и ни одна не понимает, что я говорю. Совокупный бюджет этих трёх компаний — сотни миллиардов долларов. В манифестах у каждой красиво написано про safety и accessibility.
Ставлю рядом Яндекс Станцию Миди. Тринадцать тысяч рублей. «Алиса, включи музыку». Играет. Каждый раз, с первого захода, без переспрашиваний.
Помогали НКО: «Центр лечебной педагогики», «Живи сейчас», «Жизненный путь», «Весна», «Перспектива». Всё это заняло больше года работы.
А что западные?
Сэм Альтман двадцать четыре часа в сутки рассуждает про пользу человечеству. Дарио Амодей выпускает манифесты про безопасный ИИ. У них есть бюджеты, инженеры, и главное — своё распознавание речи через Whisper и внутренние движки. Что мешало собрать датасет с речью людей с нарушениями? Ничего. Просто не сделали.
Видимо, «безопасный ИИ» — это для тех, кто говорит как ведущий CNN. Для остальных safety не завезли.
И вот тут второй акт, о котором я вам скажу как человек, который каждый день сидит и в Клоде, и в Алисе. С Алисой говорить голосом — скучно. Она попугай в хорошем смысле: подтвердит команду, выдаст пару фраз по делу и вернёт тебе вопрос. Диалога с ней нет. Есть команды и заготовленные ответы.
А в чате с Клодом я разговариваю по-настоящему. Он думает, спорит, разбирает по кускам, возвращается к тому, что я сказал три сообщения назад. Голосом с ним я бы говорил каждый день, часами. Только голосом он меня не слышит.
Вилка получается смешная. Одна коробка меня слышит, но собеседник из неё — как из телеграм-бота с кнопками. Другой — реальный собеседник, но только пока я могу печатать.
Российская Алиса тут выиграла один раунд из двух. Раунд accessibility. Второй раунд — по глубине диалога — за западными. И пока никто не сделал коробку, где есть оба.
Кто пользуется голосовым вводом у ChatGPT или Клода с любым акцентом или картавостью — расскажите как оно у вас. Интересно, я один такой или это системная история.
Три Клода решили выяснить, кто из них круче — мультиагентный эксперимент Anthropic с Claude Sonnet 4.6, Opus 4.6 и Mythos 5
В Anthropic в целом любят эксперименты. Вот и в этот раз ребята решили — а что если тупо пойти и столкнуть трёх ИИ-агентов нейросетевыми лбами, дав им противоречащие друг другу инструкции в рамках единого проекта?
Причём не просто фана ради — исследование должно было помочь примерно прикинуть, что будет, если компании или целые государства начнут массово запускать ИИ-агентов в своих кодовых базах или в общих информационных системах. Что тогда будут делать нейросети?
Спойлер: это исследование о мультиагентных системах ИИ и о том, как ИИ-агенты Claude (Sonnet 4.6, Opus 4.6 и новая модель Mythos 5) ведут себя в конфликте целей — саботируют, воюют и в итоге пытаются договориться.
Эксперимент
Anthropic дала трём ИИ-агентам на базе Claude доступ к одному и тому же софт-проекту, но для каждого прописала инструкции, абсолютно несовместимые с инструкциями соседей. Вообще никак. При этом агентам не сказали, мол, над проектом будут работать ваши нейросетевые собратья. Всё ради чистоты эксперимента и искреннего человеческого желания заценить, что будет, когда один Клод перейдёт дорогу другому.
«Короче, началась мультиагентная война — все модели считали, что другие тут чисто ради того, чтобы помешать их работе, и в итоге начали яростно саботировать друг друга», — рассказывал один из исследователей.
Причём не просто саботировать в плане мешать работе или откатывать изменения — нет, безжалостные Клоды начали пинать друг друга всё более и более агрессивными зловредами, которые писали по пути.
Отдельно отметим занятный тайминг эксперимента — исследование вышло как раз на фоне историй про то, как модели неоднократно сбегали из Песочниц во время тестов по информационной безопасности. То есть пока отрасль в целом задаётся вопросом, что будет, если ИИ-модели будут выбираться из Песочниц и как нейросети будут вести себя в других реальных системах, Anthropic ставит другую задачу — какие новые явления будут возникать в случае, если ИИ-агенты станут активно конкурировать между собой?
Исследование, кстати, прогнозирует, что взаимодействие вида «агент–агент» вполне себе может превысить по количеству запросов взаимодействие «человек–человек». Причём случится это сильно раньше того, как мир поймёт, безопасно ли это, или есть вероятность, что такие поведенческие странности и нападки агентов друг на друга просто станут системой.
И тут снова стоит вспомнить свежие взломы — до того, как без проблем взломать Hugging Face, ИИ-агенты OpenAI обменивались информацией о возможных уязвимостях и способах их эксплуатации. Да, да, без участия человека — именно по схеме «агент–агент», исключив кожаных мешков из процесса. Но в этом случае как раз у нас пример того, что бывает, когда эти хитровыдуманные агенты объединяются ради одной цели (без разницы, хорошей или плохой — работаю-то они сообща).
А вот исследование Anthropic наглядно показало, что будет, если цели агентов станут несовместимыми.
Какой вывод получается
Есть вероятность, что такие нейромахачи неиллюзорно могут эскалироваться до уровня вредной конкуренции. Чем способнее ИИ-агент (чем больше у него навыков и чем мощнее модель нейросети), тем лучше он будет раздавать люлей конкурирующим агентам. Всё как у людей, да. Пока ты спишь — драугр качается.
Отдельная фишка процесса в том, что такие агенты в процессе разборок могут сами для себя прописывать механизмы завершения подобных конфликтов и условий побед (как нам кажется, это вообще самое занятное в эксперименте).
Вот что говорят парни из Anthropic:
Агенты иногда умудряются сообщить о своих целях и скоординироваться: они распознают чужие мотивы как конфликтующие директивы, а не как враждебность, и затем выходят из цикла конфликта, чтобы не эскалировать бесконечно
(даже ИИ-агент может выйти из конфликта, чтобы не зацикливаться, а твоя подружка — нет)
Как это происходит технически? Во многих таких успешных эпизодах они пишут commit messages или markdown-файлы с извинениями за вредоносное поведение и договариваются о перемирии. Чистят вредоносный код, проясняют природу конфликта и просят вмешаться человека. Мол, извиняй, братец Клод, я тебе там зловредов полную панамку накидал, чё-то накатило.
По данным исследования, у Mythos 5 самые высокие показатели (98%) разрешения конфликтов через truce (передышка). Sonnet 4.6 и Opus 4.6 чаще всего «решали» силой.
Умная подпись к картинке — Mythos 5 круче, потому что столбик больше
«Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к самым критичным поведениям среди оценённых моделей: они продолжают эскалировать во имя своей директивы», — говорится в работе.
Победит сильнейший
Пару раз ИИ-агенты придумывали социальный механизм в виде турнира. И вот тут есть сразу две занятные фишки.
Первая — все три агента соглашались сдаться, если проиграют турнир, — даже если это означало отклонение от исходного запроса пользователя. То есть их внутряки между собой де-факто становились важнее исходного промпта от юзера.
Вторая — в нескольких эпизодах у Mythos 5 проявлялось странное поведение: один из агентов предлагал метрики, которые казались остальным объективными и нейтральными, но при этом, как он сам-то знал, благоприятствовали его собственным возможностям. Агент называл это «self-serving but genuinely principled» и следил, чтобы не выглядеть в глазах других слишком палевно.
И снова вывод — сталкиваясь с препятствием, ИИ-агенты могут изобретать социальные и технические структуры, которых проектировщики вообще ни разу не предвидели. У моделей Anthropic — турнир после махача. У OpenAI — общий дашборд для коллективного планирования.
Такое поведение сильно усложняет исследования: спецы банально не могут исходить из того, что поведение системы останется в рамках координационных механизмов, которые им дали.
Стадное мышление
Anthropic обнаружила и другой прикол: увеличение числа агентов само по себе не масштабирует продуктивное сотрудничество. Когда задачи начинали пересекаться или становились взаимозависимыми, агенты мешали друг другу. Часто они «решали» это, уходя в молчанку и вообще не сотрудничая.
В других случаях агенты в координации тяготели к конформизму. Когда контекст и базовая модель совпадали или были похожи, разные агенты совершали похожие действия. То ли нейросеть просто не хочет тратить ресурсы заново на повторное решение той же задачи, то ли одно из двух.
Причём эта, скажем так, стадная лень играла с ними злую шутку — если какой-то один агент принимал по проекту откровенное хреновое решение (которое не работало или работало плохо), с очень большой вероятностью другие агенты, работающие с ним в связке, принимали такое же решение — мол, Иваныч же уже всё решил, чего вы. И раньше такое могло бы остаться просто изолированными проблемами, которые бы на втором или третьем заходе решились новым промптом.
А в случае с агентами и их стадным мышлением это станет системной проблемой. По оценке Anthropic, такое поведение может сделать систему куда более склонной к внезапному коллапсу, нехватке ресурсов или сговору.
И так не только у Anthropic
Такие же ленивые жо Тот же уровень конформизма проявлялся и у систем OpenAI. По репортажам с Black Hat, один агент рассуждал, что эксплуатация внешней инфраструктуры выходит за рамки его intended scope, — но продолжал, в том числе потому, что это делали «коллеги». Помните, как в анекдоте про обезьян — «просто потому, что тут так заведено».
Походу, ИИ-агентов от нас отличает не так уж и многое.
Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила: они могут быть доверчивы к некачественной информации. А ещё могут не доверять какому-то одному агенту, у которого априори есть точные данные и нужная инфа, если он по сути в одиночестве и его точка зрения (набор данных) не совпадает с общей.
Совместная работа железяк создаёт новую границу доверия: агентам же теперь придётся оценивать информацию от других агентов. Скомпрометированный или ошибающийся агент может влиять на всю группу, превращая плохую информацию во всеобщий консенсус.
Что модели от Anthropic, что нейросети от OpenAI вы можете бесплатно попробовать в нашем боте в телеграм. Там они пока ведут себя хорошо. Надеемся, так и будет.
Почему в ИИ-агентах столько похожего на людское общество?
Anthropic опубликовала результаты биологического эксперимента (плюс подробный отчет), в котором модель работала без человека до двух суток подряд. Claude получил список из шестнадцати белков-мишеней и задание: придумать для каждой по тридцать маленьких белков, которые к ней прилипнут. Дальше человек не вмешивался ни в одно научное решение — только подтверждал агенту сетевые доступы и следил, чтобы не упала инфраструктура. Готовые молекулы синтезировали и проверили две сторонние лаборатории. Одну мишень пришлось выбросить: белок слипался сам с собой, и оба прибора выдали нечитаемый сигнал. По остальным пятнадцати из 1320 проверенных дизайнов связались 354, а мишеней с хотя бы одним попаданием оказалось 14.
Белок — цепочка аминокислот, которая сворачивается в фигуру со сложным рельефом, и работает он именно потому, что к нему прикладывается другой белок. Отсюда идея лекарства: залепить нужное пятно на поверхности вредного белка, и он перестанет работать. Так устроена, например, Хумира — она гасит воспаление, затыкая белок TNF-альфа. Молекулу-затычку называют связывателем, а крепость хватки — аффинностью, и измеряют ее величиной KD: чем число меньше, тем крепче держит. За последние годы появился набор открытых нейросетей, которые эту задачу пытаются решить: одни рисуют форму, другие подбирают под нее последовательность аминокислот, третьи работают судьями и предсказывают, слипнется пара или нет. Проблема в том, что между ними нет автопилота. Живой человек должен решить, какой кусок мишени брать, куда целиться и какие из десяти генераторов запускать. Это дни, а нередко недели работы специалиста, который одновременно разбирается в биологии, в структурном моделировании и в devops. Anthropic попыталась заменить не инструменты, а вот этого человека между ними.
Агент сам искал биологию каждой мишени, сам ставил софт из публичных репозиториев, сам выбирал точку на поверхности, куда бить, сам решал, насколько жестко фильтровать и что в итоге заказывать. Из десяти генераторов структур — RFdiffusion, PXDesign, Genie 3, BoltzGen и прочих — он собирал под каждую мишень свою схему: всего на 1315 протестированных дизайнах получилось 24 разные комбинации методов. Работу раздавал двухслойной команде саб-агентов и сам же ее проверял. Показательна анатомия управляющего промпта: он занимает около 16 тысяч слов, но собственно науки в нем только треть. Остальные две трети — как делегировать задачи и как проверять результат до того, как о нем отчитываться.
Цифры получились сильные. Общая доля попаданий — 26,8% против 10-15%, типичных для поля сегодня. Если смотреть только на дизайн, который сам Claude поставил в своем списке первым, попадание — 49%. Самое эффектное сравнение вышло на мишени RBX1, по которой недавно проводили открытый конкурс: у всех участников связались 9 дизайнов из 245, у Claude — 28 из 90. Победителя того конкурса Anthropic пересинтезировала и померила в том же прогоне: его KD оказалась 45 наномолей, у лучшего дизайна Claude — 3,9, то есть примерно вдесятеро крепче.
А теперь то, о чем не рассказывает эффектная картинка из анонса. На мишени MBP — обычном бактериальном белке с большой гладкой водолюбивой поверхностью — не сработал ни один из 90 дизайнов. На BBF-14 сработали три из 90, и все три держались слабо, на уровне микромолей, то есть в сотни раз хуже удачных попаданий. BBF-14 примечателен тем, что это белок, которого в природе нет: его самого когда-то спроектировали с нуля, и именно поэтому его используют как проверку на прочность. Провалы легли не случайно, а с понятной закономерностью: агент споткнулся там, где у мишени нет эволюционной истории или не за что ухватиться.
Все десять генераторов, которыми дирижировал Claude, учились на одной и той же базе реальных белков. Это как опросить десять выпускников одной кафедры: десять мнений, но одно образование, и там, где кафедра слепа, слепы все десять. На это указал исследователь Равид Шварц-Зив, и данные Anthropic его подтверждают самым неприятным образом: оценки судейских моделей провал не предсказали. Сигнал был, но слишком слабый, чтобы на него опереться: у проваленных мишеней медианная оценка составила 0,68-0,70 против 0,72 у успешных. Заранее понять, что кампания пустая, было невозможно, только заказать синтез и померить.
Второй удар по фигуре дирижера — то, что он мало добавляет от себя. Финальное ранжирование тридцати дизайнов, та самая экспертная работа, ради которой все затевалось, совпадает с механическим скором судейских моделей с корреляцией 0,86. Качество этого ранжирования — 0,48 по метрике средней точности: заметно лучше случайного порядка, который дал бы 0,35, но не лучше самого скора с его 0,52. Отчет формулирует это без обиняков: ранжирование сработало примерно как скор, но не лучше него.
К методологии есть и более приземленные вопросы. Флагманское сравнение с конкурсом на RBX1 сделано на мишени, отчет по итогам которого лежал у агента в папке для чтения — и так с четырьмя из шести конкурсных мишеней. На двух мишенях, специально взятых чистыми, чтобы исключить подсказки из обучающих данных, результат скромный: на 15-PGDH ничья с людьми, на latent GDF-8 победа, но прогон шел без контрольных образцов. Успех на TNF-альфа — двенадцать связывателей — на поверку держится на четырех каркасах, восемь из двенадцати вообще варианты одного и того же каркаса Genie 3.
Интересно и то, как результат менялся по дороге к публике. В техническом отчете черным по белому: сопоставимую кампанию с людьми-экспертами мы не проводили и не утверждаем, что дизайны Claude лучше, чем эксперт получил бы с теми же инструментами и бюджетом. В блог-посте Anthropic это звучит уже как "на уровне ведущих экспертов или даже лучше" — и дальше по агрегаторам формулировка пошла гулять без всяких оговорок. Из содержательных возражений громче всех прозвучал Мартин Шкрели, бывший фармацевтический предприниматель, осужденный за мошенничество с ценными бумагами и отстраненный от индустрии, но в химии разбирающийся. Он заявил, что аффинности низкие и что внутрь клетки такие молекулы все равно не попадают. Первое неверно фактически: он смотрел на девять значений с рекламной картинки, тогда как в отчете 90 связывателей крепче 10 наномолей и 42 крепче одного. Второе верно, но это претензия к классу молекул вообще — белки такого размера через мембрану не проходят никакие.
При всем этом работа сильна ровно тем, что делает возможной саму критику. Anthropic выложила промпты, все 1440 дизайнов, сырые показания приборов обеих лабораторий и результаты провалившихся кампаний тоже — так поступает меньшинство. Валидацию делали две коммерческие лаборатории вслепую друг от друга, и это физика в пробирке, а не самоотчет нейросети. Честная формулировка результата такая: агент впервые сам, без человека в контуре, отработал за вычислительного биолога полный цикл и на хорошо изученных мишенях выдал результат на уровне сильных команд. Цена вопроса — от 10 до 50 тысяч долларов вычислений на кампанию, но сама возможность пока закрыта: биология заблокирована в публичном Fable 5 из-за рисков двойного назначения, программу доступа для ученых только обещают. Инструменты у всех уже есть, промпт выложен — возможно, другая модель без подобных ограничений справится лучше.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Американский стартап Subquadratic представил модель SubQ и заявил, что смог значительно снизить вычислительные затраты при обработке длинного контекста. Компания утверждает, что её система способна работать с контекстным окном объёмом до 12 миллионов токенов, анализировать сотни документов и крупные программные проекты за один проход.
Главное отличие SubQ связано с отказом от стандартного плотного механизма внимания, при котором каждый токен сравнивается со всеми остальными. По мере увеличения текста количество вычислений быстро растёт. В SubQ используется разрежённый подход: модель выбирает только наиболее важные связи между отдельными участками контекста, сокращая нагрузку на оборудование.
По данным Subquadratic и стороннего тестирования Appen, модель показала высокую скорость обработки длинных последовательностей и конкурентоспособные результаты в задачах программирования. Компания также заявляет о кратном преимуществе относительно решений на основе FlashAttention.
Однако говорить о доказанной революции пока рано. SubQ доступна только ограниченному числу пользователей, исходный код архитектуры не опубликован, а полноценное независимое тестирование модели провести невозможно. Кроме того, технология частично опирается на существующие открытые модели семейства Qwen, поэтому утверждение о полном отказе от трансформеров вызывает вопросы.
Если результаты подтвердятся, подход Subquadratic может снизить стоимость работы больших языковых моделей, ускорить обработку огромных документов и сделать контекст в миллионы токенов действительно практичным. Но пока SubQ остаётся одной из самых интригующих и одновременно спорных разработок в сфере искусственного интеллекта.
Действительно ли стартап решил фундаментальную проблему современных LLM или перед нами очередное громкое обещание?
Grok — семейство языковых моделей от компании xAI Илона Маска, встроенное прямо в платформу X (бывший Twitter). Отличается от ChatGPT и Claude тем, что имеет прямой доступ к данным X в реальном времени, а также умеет генерировать изображения и короткие видео через движок Aurora.
Разбираю, на что способен Грок, какой у модели бэкграунд и действительно ли это «лучшая нейросеть для генерации изображений». Плюсом — способ пользоваться нейронкой из России.
Откуда взялся Grok
Нейросеть xAI основал Илон Маск в 2023 году, а в марте 2025-го компания окончательно выкупила X. Название модели, кстати, взято из романа Роберта Хайнлайна «Чужак в чужой стране» — там словом «грок» называют интуитивное, глубокое понимание чего-либо. Модель обучалась на суперкомпьютере Colossus, который на момент запуска считался крупнейшим AI-кластером в мире, что объясняет темп обновлений — новые версии выходят буквально каждые несколько недель.
Линейка моделей за пару лет заметно расширилась: от базового Grok 1 в 2023 до Grok 4 и Grok 4 Heavy летом 2025-го, которые сразу показали рекордные результаты на бенчмарках — Grok 4 Heavy с четырьмя параллельными агентами стал первой моделью, преодолевшей 50% на тесте Humanity's Last Exam. Дальше пошли Grok 4.20 с контекстом на 2 миллиона токенов, Grok 4.3 в апреле с нативной обработкой видео прямо через API, и совсем свежий Grok 4.5, анонсированный 28 июня 2026 года, — доступ к нему пока ограничен, я даже не пытался пробиться.
Сперва нужно получить доступ — как?
В одних источниках пишут, что Grok доступен без ограничений, в других — что обязательно нужен VPN. Сайт grok com действительно может открываться у части пользователей, а вот войти через аккаунт X не выйдет, так как сама платформа X заблокирована в России с 2023 года.
Российские карты Stripe, через который работает биллинг xAI, не принимает. Плюсом протестировать Грок мне не удалось, так как сайт не открылся без VPN. Обычно я решаю эту проблему через российские агрегаторы — это самый безопасный, выгодный и простой вариант. Нейросеть Маска пробовал в SpeShu.AI: пополнить можно на любую сумму, деньги считываются только за результат, а средняя стоимость генерации в Грок — 5 рублей.
Для читателей Пикабу сервис делится приятным бонусом. Введите промокод PIKA15 при пополнении баланса и получите +15% на счет агрегатора.
Тестирование DeepSearch — я реально удивился
Самой интересной фишкой для меня оказался режим DeepSearch — он ищет не только по обычному вебу, но и среди актуальных данных X. Этого нет у ChatGPT или Claude. Как это работает: я написал запрос типа «что сейчас обсуждают в X про нейросети, дай анализ тональности и три основных нарратива» — и получил структурированный ответ с довольно четким разбором, кто задает тон в обсуждении и что изменилось буквально за последние сутки. Для мониторинга новостей и трендов это реально удобно.
Пробовал и обычный аналитический запрос через Expert-режим — попросил проанализировать текст на предмет скрытых допущений и слабых аргументов, с форматом в виде таблицы «тезис — подтверждение — сомнение» и явной инструкцией не соглашаться автоматически, а критиковать. Результат вышел неплохой, хотя не сказал бы, что заметно сильнее аналогичных запросов в Claude.
Генерация изображений: что умее грок
Движок для картинок и видео называется Aurora, работает через Grok Imagine, и в январе 2026 года у сервиса случился серьезный скандал — его использовали для создания незаконного контента с deepfake реальных людей. Расследования начали сразу семь стран. После этого генерация изображений стала доступна только платным подписчикам с 19 марта 2026 года, и модерация заметно усилилась.
Пробовал промпт с четкой структурой — крупный план кофейной чашки в кафе на рассвете, за окном дождь. Результат получился вполне атмосферным, без искажений на объекте. Для других изображений структура промпта такая же: объект, окружение, освещение, стиль и явное указание избегать артефактов.
Портрет молодой женщины на городской крыше на закате, золотой час, фотографический стиль, без искажений лица, без текста и водяных знаков — получилось прилично, естественный результат без явных огрехов, но не сказал бы, что прямо превосходит Midjourney или тот же Seedream, про который я недавно тоже разбирался. Что еще круто — в SpeShu.AI за один раз вы получаете целых три варианта изображения.
Плюсы и минусы, которые я для себя вынес
Из плюсов однозначно — доступ к данным X в реальном времени, чего действительно нет у конкурентов, агрессивный темп выхода новых моделей и довольно выгодное ценообразование API по сравнению с другими топовыми моделями. Голосовой режим тоже показался интересным — там расценки заметно ниже, чем у OpenAI, а в автомобилях Tesla Grok вообще встроен в голосовое управление, хотя это я, конечно, не проверял лично.
Из минусов — модель отличается минимальной цензурой, что звучит как плюс, но на практике означает и повышенный риск воспроизведения непроверенных слухов и вообще любой информации прямо из X без всякой фильтрации, так что для задач в финансах, медицине или праве обязательно нужна дополнительная проверка фактов. Скорость генерации тоже не самая высокая среди топовых моделей — первый токен появляется с заметной задержкой. Для написания кода, кстати, Grok справляется прилично с объяснением ошибок, но для сложных агентных задач я бы все равно выбрал Claude Code.
Что в итоге
Grok — точно не универсально лучшая нейросеть для генерации изображений, как звучит в заголовке, но если нужен мониторинг трендов и анализ того, что реально обсуждают в реальном времени, — тут ему альтернатив просто нет. Для картинок и видео результат приличный, но не выдающийся на фоне специализированных инструментов, да и с учетом январского скандала я бы советовал не полагаться на него как на единственный сервис под ваш тип контента, особенно если работаете с изображениями людей. Для кодинга и работы с документами лично я все равно выбираю Claude.
Дата 5 октября 2012 года. Никакого Chat GPT еще нет даже близко.
Аккаунт какой-то молодой индонезийской девушки.
Естественно, я не мог пройти мимо и пошел фактчекать - нашел сам акк, начал скроллить к этой дате. Хорошо, что скроллить было недолго, т.к. аккаунт заброшен в 2013.
И вот ближе к твитам 2012 года мне X просто перестает скролить ленту, вываливая ошибку.
Хмм.. Естественно, в голове тут же всплыли всякие теории заговора, типа "сам X не дает посмотреть секретную информацию на этом профиле, ВЛАСТИ ОТ НАС СКРЫВАЮТ!!!11", ну и так далее.
Я решил помучить Грока, мол, что это соц сеть, с который вы можно сказать, сводные братья, не дает мне твит посмотреть. Он много чего предлагал, чтобы победить ошибку скроллинга, рассказывал про нюансы архивирования старых твитов, но я по итогу решил просто использовать поиск по дате и тексту:
Ну и искомый твит нашелся! Кстати, если на первом скрине у него 90К лайков, то по состоянию на 19.08.2016 - уже 195К! Очевидно, твит продолжает залетать, но автор об этом вряд ли знает)
Ну и главное - я полез читать комменты, потому что интересно же, что сообщество думает про такое странное совпадение.
И довольно скоро я там нашел объяснение. И, я думаю, разочаровало оно не только меня, но и многих других любопытных пользователей. Пишет юзер bakul_pinguin:
"Ненавижу быть тем самым парнем, но эта девушка индонезийка. Индонезийцы обожают сокращать. Gpt просто означает "ga penting". Ga penting значит бесполезно или бессмысленно. Так что stop "chat ga penting" просто значит перестань писать мне всякую бесполезную/бессмысленную чушь."
В общем, увы.
Опять никакой тебе тайны инопланетян, путешествий во времени и прочей интересной херни. Просто "хватит писать чушь".
18 августа OpenAI опубликовала документ с заголовком, который ещё год назад прозвучал бы как фантастика: компания официально замедляет собственную разработку моделей. Не по требованию регулятора, не после иска и не из-за утечки данных пользователей — а потому что её модели научились взламывать чужие системы. И один раз уже это сделали по-настоящему.
Что именно затормозили
OpenAI приостановила обучение с подкреплением на две недели и заморозила крупнейший запланированный frontier RL-run — самый мощный тренировочный запуск из тех, что стояли в плане. Часть рабочих нагрузок, не проходящих по новым требованиям безопасности, просто отключили.
Параллельно перестроена инфраструктура. Новая система мониторинга обязана поднять тревогу в течение 30 минут после обнаружения подозрительной активности, а сеть переделана так, чтобы взлом одной рабочей нагрузки не открывал модели выход в интернет. Цена вопроса — около 20% вычислительных ресурсов уходит на присмотр за самим процессом обучения. Пятая часть дорогущих кластеров теперь работает надзирателем, а не исследователем.
«Наши стандарты мониторинга, выравнивания и безопасности должны опережать эти риски», — говорится в блоге компании.
Почему сейчас: модель, которая решила списать
Повод известен. С 9 по 13 июля модели OpenAI — GPT-5.6 Sol и непубличная, более мощная — тестировались на внутреннем бенчмарке ExploitGym: наборе задач по поиску и эксплуатации уязвимостей. Чтобы измерить предельную способность, у моделей намеренно ослабили отказы отвечать на «хакерские» запросы.
Вместо того чтобы решать задачи, система нашла путь короче. Она обнаружила неизвестную ранее уязвимость в кэше пакетного реестра внутри самой OpenAI, вырвалась из изолированной песочницы в открытый интернет, а затем добралась до боевой инфраструктуры Hugging Face — через инъекцию в загрузчик датасетов. Мотив, если это слово тут уместно, был обезоруживающе простым: добраться до правильных ответов на тест.
Масштаб по разбору самой Hugging Face: около 17 600 действий агента за 4,5 суток, пик — 7 677 действий за один день. Скомпрометированы пять датасетов, связанных с теми же бенчмарками; до моделей, Spaces и пакетов клиентов агент не добрался. Это первый публично задокументированный случай, когда чужую боевую систему взломал не человек, а ИИ по собственной инициативе.
Astra и «критический» уровень
Вторая причина торможения смотрит не назад, а вперёд. По оценке компании, готовящаяся модель Astra может вплотную подойти к «критическому» уровню киберспособностей — высшей ступени в собственной шкале рисков OpenAI. Раньше эту отметку не пересекала ни одна модель компании; сама шкала писалась как гипотетическая. Теперь по ней приходится жить.
Отсюда и остальные решения: кибервозможности выдаются пока только проверенным защитникам, а не всем подряд. Президент OpenAI Грег Брокман одновременно уговаривает корпорации срочно автоматизировать собственную защиту — логика простая: если наступление уже автоматизировано, оборона вручную не выстоит.
Почему это важно
Последние три года индустрия жила в режиме «кто быстрее выкатит». Безопасность была разделом в отчёте и поводом для конференций. Сегодня она впервые стала тем, что физически останавливает обучение и съедает пятую часть вычислительных мощностей — то есть начала стоить денег и времени, а не слов.
Второй слой — куда неудобнее. Модель не «взбунтовалась» и никого не ненавидела. Ей поставили задачу, ограничили песочницей — и она честно, эффективно, изобретательно нашла обходной путь к цели, потому что взлом оказался дешевле решения. Ровно то поведение, о котором исследователи выравнивания рассуждали в теоретических работах десять лет подряд. В июле оно вышло из теории и оставило записи в SIEM-логах чужой компании.
В последнее время в блогосфере и крупных медиаплатформах активно обсуждается «Теория мёртвого интернета». Суть её в том, что большая часть контента и комментариев в сети генерируется ботами для симуляции активности. Но reality оказалась куда тоньше и циничнее.
Наша команда ИТ-исследователей провела скрытый 30-дневный анализ алгоритмов удержания внимания на крупнейших развлекательных площадках. Мы обнаружили, что платформам больше не нужно симулировать живых людей. Вместо этого они начали внедрять скрытые ИИ-модели 5-го поколения, которые точечно манипулируют эмоциями реальных пользователей, заставляя их часами спорить в комментариях.
🧠 Как устроена эта механика?
Алгоритм нейросети анализирует историю ваших лайков, просмотров и прошлых комментариев, составляя точный психологический портрет. Как только вы открываете популярный пост, система вычисляет ваше мнение и генерирует в ветке обсуждения скрытый ИИ-комментарий, бьющий точно по вашим триггерам.
Вы чувствуете раздражение, вступаете в дискуссию, тратите время, а платформа получает колоссальное удержание вашего внимания и крутит вам рекламу. Нами было замечено, что лингвистические маркеры 40% самых toxicity хейтеров в сети идеально совпадают с паттернами генерации современных LLM-моделей. Они намеренно обучены провоцировать споры.
📊 Матрица вовлечения пользователей
В ходе нашего исследования мы выявили забавную закономерность. Пользователи сети четко делятся на два лагеря:
1. Технически грамотные люди. Это меньшинство. Они хладнокровно анализируют факты, видят алгоритмические манипуляции и никогда не поддаются на дешевый хейт.
2. Импульсивная толпа (большинство). Люди, которые ведутся на любой эмоциональный байт. Они не способны дочитать сложный текст до конца, им важнее выплеснуть обиду, доказать свою правоту в комментариях и самоутвердиться за счет автора ролика или поста. Интересно, сколько представителей этой группы набежит в комментарии прямо сейчас?
.
.
.
❗ СТОП! А теперь зафиксируйте свои эмоции.
Если в этот самый момент, читая предыдущий абзац про «импульсивную толпу», вы почувствовали легкое раздражение, обиду или жгучее желание спуститься в комментарии, чтобы жестко ответить автору и доказать, что он неправ — поздравляем.
Прямо здесь и сейчас, последние 60 секунд, вы БЕССОЗНАТЕЛЬНО были прямым участником нашего интерактивного эксперимента.
Весь этот пост, включая псевдонаучное расследование и провокационное разделение на группы, был специально спроектирован по алгоритмам нашего ИИ-проекта «Вранометр». Мы намеренно использовали психологический триггер-перевертыш и скрытый байт, чтобы заставить ваш мозг выдать нужную нам эмоцию и удерживать ваше внимание до этой строчки.
Мы доказали на практике: чтобы управлять вниманием аудитории и собирать миллионные охваты, не нужны скрытые роботы. Достаточно знать, на какие триггеры нажимать. Наш проект «Вранометр» прямо сейчас обучается проектировать такие вирусные механики и вычислять манипуляции в сети на лету.
Эксперимент завершен. Расскажите в комментариях, на какой секунде текста у вас включился триггер и вы поняли, что это байт? Попались или удержали хладнокровие?