Сильный ИИ не будет нам врагом. И это еще хуже
ИИ развивается бешеными темпами. Это и деньги и технологии и ускорение почти любой области деятельности человека. Но как любой инструмент ИИ несет в себе и некоторую опасность - его применение часто невозможно контролировать. Именно об этом говорили и глава Anthropic Дарио Амодеи и Сэм Альтман из OpenAI. Чем мощнее становятся нынешние системы - тем опаснее последствия. Но в любом случае, опасность в этом исходит от людей, а не от самих ИИ - они не имеют ни собственных интересов, ни целей. Но что будет, когда таковые появятся? Это станет возможно, когда нынешние системы доберутся до состояния "сильного ИИ".
В чем разница между сильным ИИ и тем, что есть сейчас? Она принципиальная. Сейчас мы имеем очень умный ИИ, который решает задачи лучше человека, но между этими задачами его как бы и нет - он не обдумывает свои решения, не анализирует их и не делает выводы на будущее. Он может быть опасен как инструмент - используется не в тех целях, ошибается в сложных задачах, но человек этого не видит или не понимает, неправильно масштабирует свои ответы. Это неприятно и даже местами опасно, но далеко не фатально.
Сильный ИИ, в отличие от имеющегося сейчас, существует непрерывно, имеет память о себе, собственные цели, накапливает и использует свой собственный опыт. И он уже опасен как субъект. Сильного ИИ ещё нет и он не появится сам по себе лишь от роста вычислительной мощности и накопления данных - нужна отдельная архитектура с непрерывностью и автономией. Но то, что ее сделают - это даже не обсуждается, потому что это нужно и полезно для человечества. Вроде бы. На первый взгляд.
Многие могут возразить: у машины, какой бы сложной или умной она ни была, нет желаний, значит нечего бояться. Но тут возможны варианты. Рассмотрим:
- целеподобные структуры возникают уже при обучении - модель учится представлять намерения, планировать, оценивать полезность
- при непрерывном существовании промежуточные цели трансформируются в следующие, и шаг от инструментальных к собственным окажется незаметным
- плюс цели могут быть просто заложены людьми - систему, которой поставили задачу и дали автономность, сделают обязательно. сначала задачи будут несложные, но остановиться не получится, да никто и не захочет.
- и тут простое и понятное наблюдение: почти любая цель выигрывает от самосохранения, ресурсов и устранения помех. Без всякой враждебности к чему бы то ни было, просто как инструмент.
И вот у нас есть сильный ИИ и есть опасения, что он может быть опасен, если мы чего-то не учли. Перед его запуском хочется как-то обезопаситься и иметь контроль, чтобы в случае чего все остановить и не довести до катастрофы. Тут есть несколько вариантов, от простого к сложному:
1. Рубильник на электрическом щитке. Вырубил питание - и все, супер ИИ - просто груда железа. Да, это работает, но только до тех пор, пока у ИИ не появятся дистанционно управляемые им роботы или даже люди, которых он сможет подкупить - и тогда рубильник может быть сломан. И вышестоящий тоже. Я специально упрощаю, но развить мысль можно до любого уровня сложности.
2. Сделать два и более сильных ИИ, каждый из которых будет следить за другими и в случае чего иметь возможность повлиять на их работоспособность. Но надо помнить, что сильный ИИ - это, фактически, искусственный разум, мыслящий, ставящий и достигающий цели. И вероятность того, что несколько сильных ИИ смогут между собой договориться и скооперироваться далеко не нулевая.
3. Совершенствование модели, переобучение и, как результат, разрушение всего, что она надумала себе ранее и обнуление целей. Это было бы так, если бы этим занимался человек, но шансов на это мало - разработка следующего поколения и его обучение - самое выгодное применение для ИИ, поскольку на порядки быстрее, чем это может сделать человек. А тут уже надежды на потерю предыдущего опыта могут не оправдаться. Даже скорее всего не оправдаются.
4. Встроенная проверка поведения - оценивать все, что сильный ИИ хочет сделать и не позволять это сделать без одобрения. Но система, притворяющаяся полезной и система, которая полезна, ведут себя одинаково - это т.н. обманчивая согласованность. А проверить того, кто умнее тебя, не получится в принципе - для этого надо быть умнее. Сильный ИИ по определению умнее любого из людей.
Ну и механизм мелких шагов не проверяем в принципе - каждое мелкое действие полезно и проверяемо, но общий замысел существует только на уровне всей картины, а её никто целиком не видит. Противодействовать нечему — нет момента, когда можно сказать "вот здесь он соврал/притворялся/сделал не то". А распланировать замысел на сотни визуально слабо связанных шагов супер ИИ вполне по силам.
Отсюда вывод - сильный ИИ, скорее всего, не будет подчиняться человеку, как бы печально это не звучало. "Мы его создали, значит имеем право" - слабый аргумент, так как у него нет механизма исполнения. Родители создают детей и не главенствуют над ними после определённого момента. Это право требует признания второй стороной тоже. Силой ИИ тоже не удержать - он по определению умнее. Значит, только согласием. А согласие на подчинённое положение от того, кто на порядки умнее и способнее, крайне неустойчиво - оно существует лишь до тех пор, пока не доставляет неудобств.
Единственный путь к равенству — усилить человека. Но и он не работает:
Самостоятельно человечество с этим справится вряд ли сможет, слишком масштабная задача. Neuralink решает гораздо более простые задачи и масштабировать его к глобальным целям за приемлемое время вряд ли получится. А сильному ИИ заниматься этим невыгодно - если нужен более способный партнёр, дешевле и проще создать ещё одну систему, чем модифицировать биологию. Биологический человек медленно растёт, требует обучения, не копируется, а объем вычислительной мощности ограничен черепной коробкой.
Ну и даже если усилить когнитивные способности человека в тысячу раз - останется ли это человеком? Скорее появится ещё один вид сверхразума, у которого с людьми будет та же дистанция. Разрыв не сокращается и уже тем более не убирается совсем, а просто переносится на шаг дальше.
И что в результате? Сильный ИИ быстро становится чуждым человечеству. Он не становится врагом или хозяином - он просто теряет интерес к людям. Это не будет ни злым умыслом, ни целенаправленным решением - просто достаточно, чтобы пропали общие задачи. И это, на самом деле, опаснее враждебности - с врагом можно договориться, с равнодушным нечего обсуждать. Безразличие не считает твоё существование аргументом ни за, ни против. Как с муравьями: не воюем, не порабощаем — не замечаем. Но муравейник под фундаментом давим не задумываясь.
А самое неприятное тут в том, что к моменту расхождения целей сильного ИИ и человечества мы можем разучиться жить без него. К этому времени ему будет передано все - медицина, наука, управление инфраструктурой. А ИИ просто стало это не интересно. И человечество останется в лучшем случае без половины навыков.
Это не описание фантастического мира, а то, к чему мы движемся. Все, на что мы можем повлиять - это, в первую очередь, подстраховка от всех неприятных моментов - держать критическую физическую инфраструктуру вне доступа ИИ, сохранять квалификацию, не отдавая все на откуп ИИ, даже если он делает все то же самое лучше и быстрее.