Ответ на пост «AI, AGI, ИИ и прочие LLM»1
Очень интересная статья, но боюсь, в одном вы неправы. Вы считаете, что LLM - обычная "переобученная" (переобученная - в смысле неправильно обученная) нейросеть. Вы должны знать, что такое случается, когда нейросети со слишком большим числом параметров "скармливают" крайне ограниченный датасет и она вместо того, чтобы обучиться и найти какие-то паттерны и закономерности "тупо" запоминает все вариации данных в датасете. В части LLM все же нужно признать, что количество параметров нейросети и объем датасета абсолютно несравнимы - миллиарды параметров против триллионов токенов, т.е. "переобучить" ее невозможно. Это означает, что она в какой-то степени начинает "понимать" полученный датасет, а не просто является "попугаем". Из этого вполне может следовать, что LLM могут генерировать совершенно новый контент. Тут можно провести параллель с человеческим мозгом - мы не знаем, как он работает и как ни странно, то же самое можно сказать и об обученной нейросети (причем практически любой. Это касается не только LLM, которые на самом деле являются целой сетью различных, но взаимосвязанных нейросетей). По сути, она становится таким же черным ящиком, как и наш мозг. Есть вероятность, что разработчики LLM просто попали в точку - в каком-то приближении разумеется.
> Очень интересная статья, но боюсь, в одном вы неправы. Вы считаете, что LLM - обычная "переобученная" (переобученная - в смысле неправильно обученная) нейросеть.
Не совсем, мне нехватило текста ( а скорее терпения ) чтобы описать все нюансы, хотя скорее я просто какие то части посчитал более значимыми для того чтобы попытаться передать общий смысл LLM и почему это не ИИ в общем смысле при этом не вдаваясь в архитектуру и не описывать дистиляты, МоE для этого нужно писать отдельную статью, может даже 2-3.
> Вы должны знать, что такое случается, когда нейросети со слишком большим числом параметров "скармливают" крайне ограниченный датасет и она вместо того, чтобы обучиться и найти какие-то паттерны и закономерности "тупо" запоминает все вариации данных в датасете.
Я планирую расписать это подробнее в будущем, но я посчитал что в вводной статье будет излишним пытаться объснить как работает ядро.
> В части LLM все же нужно признать, что количество параметров нейросети и объем датасета абсолютно несравнимы - миллиарды параметров против триллионов токенов, т.е. "переобучить" ее невозможно.
Все верно, по этой же причине на данный момент невозможно реализовать обучение в реалтайме на основе активного диалога, когда нейронка бы исправляла собственные веса и дообучалась на основе ошибок указанных ей человеком.
> Это означает, что она в какой-то степени начинает "понимать" полученный датасет, а не просто является "попугаем". Из этого вполне может следовать, что LLM могут генерировать совершенно новый контент.
Новый не значит уникальный и полезный, все же нейронкам нехватает таких вещей как креативность и случайный фактор, например человек может написать какую-то вещь не так как обычно и если его спросить почему он так сделал кто ответить "Я немогу это объяснить но чувствовал что так нужно сделать", хороший пример художники такие как например Дали или Рерих, почему они решили рисовать именно так? Есть ли для этого логическое структурированное объяснение, скорее всего нет. Это то что на данный момент непонимают ученные и то что невозможно вложить в LLM потому что мы сами незнаем как это происходит.
Еще например момент случайного осознания, например бывает долго неможешь решить задачу, а потом делаешь что-то другое ( гуляешь, ешь и т.д ) и вдруг к тебе приходит осознание как это можно сделать, вот как это происходит? Я об этом недумал и не пытался решать эту проблему в конкретный момент просто "в голове щелкнуло" и решение пришло само.
> Это касается не только LLM, которые на самом деле являются целой сетью различных, но взаимосвязанных нейросетей). По сути, она становится таким же черным ящиком, как и наш мозг. Есть вероятность, что разработчики LLM просто попали в точку - в каком-то приближении разумеется.
Полностью согласен, но пока мы этого незнаем и момент тригера все еще не решен.
Спасибо за такой подробный и интересный комментарий всегда полезно услышать альтернативное мнение, он помог понять на чем сделать акцент в будущей статье когда я переборю свою лень ( возможно даже раньше чем через год ).