Ликбез. Про параметры ИИ-моделей
Ликбез. Как работает ИИ.
Ликбез. Про ИИ и миры пользователя.
Ликбез. Как учится ИИ.
Ликбез. Про токены
Мне задали вопрос - что значит «подкрутили модель» в посте про обучение.
Дисклеймер (отмазка): автор ниже описывает логику работы модели, а не лабает диссер. Если уже на втором абзаце вам отчаянно хочется сообщить, что «на самом деле тут матрицы», «это зависит от квантования» или «автор неправильно употребил термин» - закрываем заметку с чувством заслуженного превосходства и идем к умным авторам. Я объясняю принцип нормальным людям: упрощение здесь не ошибка, а задача.
Допустим, после «мама мыла» модель оценила продолжения так: «рама» - 20%, «пол» - 15%, «ракета» - 40% и хвост из пары тысяч других вариантов, включая מִסגֶרֶת. Но в учебном тексте написано «рама». Значит, задача - понять, как так получилось и что сделать, чтобы в следующий раз в похожей ситуации вероятность рамы стала чуть выше, а ракеты - ниже.
Представим модель как облако из десятков или сотен тысяч токенов, между которыми существует чудовищное количество потенциальных связей. В самом начале обучения там почти шум: коэффициенты всех связей для нашего примера равен единице.
Теперь для простоты представим каждую такую связь как путь со своим собственным коэффициентом.
Ставим задачу: мама мыла раму.
Раунд 1: модель выбрала «инфузорию». Ошиблась. Коэффициент немного меняется так, чтобы этот путь стал слабее. Условно 1 -> 0,8.
Раунд 2: модель выбрала «машину» - опять мимо, теперь и машина стала 0,8.
Раунд 3: модель выбрала «раму» - попала. Путь, приведший к раме, наоборот, стоит усилить, коэффициент становится 1,2.
Но следующий учебный текст может оказаться «мама мыла машину». Еще следующий - «мама мыла раму губкой». Поэтому нельзя просто запомнить «рама хорошо, машина плохо». Миллионы сочетаний взаимодествуют друг на другом, и после каждого нового примера приходится поправлять всю эту картину так, чтобы усилить нужные пути, при этом не сломав, чему модель уже научилась.
Вот теперь можно попробовать объяснить, что именно мы называем параметром. В настоящей модели нет отдельного утверждения «мама мыла -> раму» с написанным на нем коэффициентом 1,2. Такие связи получаются совместной работой огромного количества параметров. Параметр - это один из миллиардов коэффициентов, которые определяют, насколько сильно один промежуточный результат внутри модели повлияет на следующий. Меняя эти числа, мы понемногу меняем всю карту возможных продолжений.
Чем больше таких параметров можно крутить в модели - тем она способнее и тем быстрее приближает тепловую смерть вселенной.