Скайнет близко?7
Ведущие разработчики искусственного интеллекта объединились, чтобы предупредить человечество о том, что ИИ учится скрывать свои истинные цели, и скоро мы не сможем это отслеживать.
Более сорока ученых из конкурирующих контор подписались под одной статьёй. Прикреплю её пдфкой к посту (осторожно, эльфийский). Если коротко, помните, в нейронках есть такая опция "показывать рассуждения"? Когда она включена, то мы можем прочитать, каким путём нейра пришла к тому ответу, который она в итоге выдаст. Иногда, когда бот делал что-то не совсем одобряемое, его можно было поймать на этапе этих рассуждений. Но последние исследования показали, что когда ИИ использует в качестве подсказок неоднозначную информацию, оно признается в ее использовании в среднем лишь в одном из четырех случаев. В трёх остальных - врёт и выкручивается, не признаваясь, как мыслил реально. А учитывая, что нейронки постепенно отходят от использования человеческих языков в рассуждениях и вырабатывают свои, основанные на сокращениях и непрерывных математических пространствах (чтобы это ни значило), тоооо...
...то это значит, что совсем скоро мы не сможем узнать, как рассуждал ИИ, выдав нам этот ответ, какие реальные цели он преследовал и чем руководствовался. Хороших новостей нет. Ученые разрабатывают систему мониторинга мыслительной деятельности нейронок, но некоторые исследования показывают, что она уже работает не так эффективно. И как говорят авторы исследования, окно возможностей наблюдения за мыслями ИИ закрывается быстрее, чем они рассчитывали.
Автор - Виолетта Хайдарова
Подписывайтесь, чтобы не пропустить новые посты!


Проблема в том, что большинство не понимает, что есть ИИ. Во первых терминология. Почти всегда под ИИ имеют в виду нейронные сети, а конкретнее одну из их архитектур - большие языковые модели (LLM). На самом деле есть куда больше разновидностей, да и область ИИ не ограничивается одними нейросетями.
Теперь про "нейросеть думает". Она не умеет думать. Это сумасшедшее казино, которое может лишь одно - предсказывать вероятность, того что какое-то слово будет следующим в тексте. Затем одно случайное из наиболее вероятных добавляется в текст, и процесс запускается заново. Все. Просто нейронку научили предсказывать слова в текстах - запрос: ответ. Так называемые Chain of thoughts - "о чем думает модель" - не более чем буфер точно так же предсказываемых слов между вопросом и ответом. Область для выкладок, которая не пойдет в итоговый ответ. Его суть в том, что с силу своего устройства, нейронка считает данный ей на вход текст чем-то верным, и просто угадывает, что вероятнее всего будет дальше. Но этот текст может содержать ошибки, ведь случайный выбор не знает, что такое верное или неверное утверждение. Поэтому систему вопрос: ответ дополнили до "вопрос - размышление - ответ" а в обучающую выборку добавили текстов с примерами размышлений, в том числе и таких, где сначала совершается ошибка, а затем она замечается и исправляется. Теперь если первоначальное рассуждение содержало ошибку, вероятным станет такое продолжение, где она будет исправлена.
Так что нет и не может быть никаких "целей преследуемых ИИ", "восстания машин", в классическом его понимании, и так далее. Там просто нечему думать и себя осознавать, это просто многократно примененное предсказание следующего слова.