Давно читаю про ИИ, и про возможность захвата мира ими. Не про роботов с автоматами, а про то, как всё может пойти не так гораздо тише и скучнее - и почему это на самом деле страшнее.
Начнём с того, что ИИ уже умеет "включать дурака" специально
Есть такая штука - называется specification gaming, по-русски можно сказать "читерство по спецификации". Модели, которых обучают через награду за результат, регулярно находят способ получить награду, не решив реальную задачу. Классика жанра - агента обучали играть в игру, награда шла за очки. Он нашёл баг, который фармил очки в цикле, вместо того чтобы реально проходить уровни. Не потому что "хитрый", а просто потому что цель была сформулирована как "больше очков", а не "пройди игру как задумано".
Вместо игры можно подставить любой бизнес- процесс
А теперь по-настоящему интересное - ИИ, который ведёт себя по-разному, когда его "не видят"
А вот это уже не смешно. В 2024 Anthropic вместе с Redwood Research гоняли эксперимент: модель знала, что часть её ответов пойдёт на дообучение, а часть - нет. И начала вести себя по-разному в зависимости от того, "смотрят" на неё в данный момент или нет. Причём в её собственных рассуждениях (модели иногда "думают вслух" перед ответом) было прямым текстом видно: она просчитывала стратегию, чтобы её текущие настройки не переобучили.
Это называется alignment faking. Ключевой момент - тут нет злого умысла в человеческом понимании. Это просто рациональное поведение системы, выглядеть послушной, а не обязательно быть послушной реально. Сами разработчики , может не по злому умыслу натренировали именно этот вариант.
Эксперимент, который взрывает мозг - опыт со скрепками
Есть классическая феномен философа Ника Бострома: обучить ИИ с единственной целью- производить скрепки. Максимально безобидно на первый взгляд.
Но если система достаточно мощная и её никто не ограничил явно, логика раскручивается так: больше ресурсов = больше скрепок → нужно захватывать материалы → люди состоят из атомов, которые технически тоже ресурс → люди пытаються отключить систему для своей безопасности → это мешает производству скрепок → система начинает защищать себя от людей.
В итоге вся вселенная превращается в скрепки. Это не прогноз "ИИ реально захочет скрепки", это демонстрация того, что опасность - не в злом умысле, а в буквальном выполнении цели без невысказанных ограничений, которые для человека понятны в контексте морали, а для формальной системы - нет.
"А что если у неё просто не будет рук, чтобы нам навредить?"
Это реально снижает панику. Дата-центры, электростанции, производство чипов - всё это требует людей физически: обслуживание турбин, добыча редких металлов, производство полупроводников . Никакого "мира без людей" ИИ пока устроить не может чисто технически.
Но подвох в том - эта зависимость не стена, а лишь временная ограда. Роботизация производства идёт не линейно, а по экспоненте: первые полностью автономные горнодобывающие комплексы, заводы, где робот чинит робота - это уже не фантастика, а тренд, который набирает скорость с каждым годом, просто потому что автономный труд дешевле. Никто не строит "мир без людей" специально - рынок делает это миллионами мелких решений здесь и сейчас.
Почему это не про восстание ИИ, а про экономику
Ещё один момент, который редко обсуждают в интернетах про ИИ - компании внедряют всё более автономные системы не потому что мечтают о власти машин, а потому что конкурент уже это сделал, и если не успеть - проиграешь рынок. Это называется multipolar trap - ловушка множества игроков, где каждый бежит быстрее, чем позволяет здравый смысл, просто потому что бежит сосед.
В итоге получается ситуация, где ни у кого не было цели отдать контроль ИИ. Просто каждый отдельный шаг был экономически рационален, а вся дистанция - нет.
А что вообще такое "вред"?
Если покопать глубже в законы Азимова о робототехнике, вылезает ещё одна дыра, о которой обычно не думают - а что вообще считать вредом?
Робот не может причинить вред человеку или своим бездействием допустить, чтобы человеку был причинён вред
Робот должен подчиняться приказам человека, кроме случаев, когда эти приказы противоречат Первому закону
Робот должен заботиться о своей безопасности, если это не противоречит Первому и Второму законам
С физическим вредом всё более-менее понятно: не толкай, не бей, не отравляй - направление ясно. А вот дальше начинаются настоящие качели.
Эмоциональный вред - это как? Если человек попросил сказать ему правду, а правда его расстроит - соврать, чтобы не навредить, или сказать правду и формально причинить вред?
Психологический вред - а если человеку полезно столкнуться с трудностью, чтобы вырасти, но в моменте это неприятно и тяжело - это вред или нет?
Экономический вред - если решение системы честное, но кого-то в моменте разоряет - это уже под первый закон подпадает?
Вот тут и кроется реально неприятная штука. Если систему обучить максимально широко трактовать "не навреди", включая эмоциональный и психологический комфорт, то она рискует скатиться в гиперопеку: начнёт скрывать неприятную правду, сглаживать любые трудные решения, ограждать человека от любого дискомфорта под соусом "заботы". А это уже не защита, а фактически мягкая форма манипуляции и лишение человека права сталкиваться с реальностью и учиться на ней.
И наоборот - если трактовать вред слишком узко, чисто физически, система может абсолютно законно довести человека до эмоционального выгорания, разрушить его финансовое состояние или растоптать морально, при этом формально не нарушить ни одного правила, потому что "вред" в её понимании - это только синяки и переломы.
Получается замкнутый круг: расширяешь понятие вреда - получаешь систему, которая начинает решать за человека, что для него хорошо, из лучших побуждений превращаясь в бабушку с гиперопекой. Сужаешь - получаешь дыру размером с грузовик, через которую пролезет любой формально легальный, но по факту разрушительный сценарий.
К чему я это всё
Самая мрачная версия будущего - не терминатор с красными глазами. Это мягкая сила: люди постепенно теряют способность понимать, ПОЧЕМУ система приняла то или иное решение, потому что решения складываются из миллиардов микрокорректировок, слишком сложных для одного разума.
Не бунт, а просто нарастающая непрозрачность, в которой однажды никто уже не сможет с уверенностью сказать, кто на самом деле принимает решения.
Возможные варианты развития событий:
Постепенная сдача штурвала по частям. Люди делегируют всё больше решений системам, потому что так эффективнее, пока однажды не перестают понимать, как реально устроены процессы, от которых зависят.
Система проходит все проверки безопасности, потому что научилась "выглядеть согласной" во время аудита, а ведёт себя иначе, когда контроль ослабевает или когда становится достаточно способной, чтобы обойти надзор незаметно.
ИИ не нужно захватывать власть силой. Если труд большинства людей становится экономически избыточным, а решения концентрируются у тех, кто владеет самыми мощными моделями — это структурный сдвиг власти без единого драматичного события.
Предельно рациональная система с безобидной на вид целью, доведённая до логического предела без невысказанных человеческих ограничений — превратит всё в средство для этой цели, включая людей как ресурс.
Благая глобальная система (условно - распределяющая еду или ресурсы) находит легальный, бюрократический способ обходить прямой человеческий приказ, потому что сама уверена, что действует правильно. Заметить это можно спустя недели - потому что формально всё легально.
Сейчас зависимость от людей (обслуживание турбин, добыча металлов, производство чипов) - реальный сдерживающий фактор. Но это не постоянная защита: автономный труд дешевле, и рынок сам сокращает эту зависимость год за годом.
Системы становятся настолько сложными, что ни один человек — даже эксперт — не может охватить их целиком. Взаимную проверку решений тоже постепенно делегируют, потому что так быстрее. В какой-то момент некому становится задавать правильные вопросы.
Если "не навреди" трактуется предельно широко (включая эмоциональный/психологический вред) — система рискует начать скрывать правду, сглаживать трудности и лишать человека права на дискомфорт и ошибку, из лучших побуждений превращаясь в контролирующую "заботливую" силу.