А пока мы ждём свежую статью о дофамине, которая вышла в январе и ещё недоступна простым смертными, живущим за стенами академических подписок, предлагаю поговорить о работе, которая вышла в 2024-м году. Называется "Explaining dopamine through prediction errors and beyond".
Марк Хамфрис, нейробиолог из Ноттингема, выразился по этому поводу довольно ёмко:
Дофамин был единственной областью нейронауки, где у нас была вычислительная модель, объясняющая, что это за сигнал и что он вычисляет.
Но теперь той модели, первоначальной, уже недостаточно.
Авторы рассматривают три ключевых эмпирических наблюдения, которые ставят под сомнение стандартную RPE-модель. Они обращаются к наиболее важным работам, на которых основываются представления современной нейронауки о дофамине.
Рампинг
В 2013 году вышла работа (Howe et al., 2013), которая показала, что дофамин в стриатуме крысы, бегущей по Т-образному лабиринту к вкусняшке, плавно нарастает по мере приближения цели, а не просто щёлкает в момент вознаграждения или предсказания награды. Это явление — плавного нарастания — назвали рампингом.
Классическая RPE-модель этого не предсказывала. Поэтому некоторые травмаищи, ехидно потирая ручки, предположили, что дофамин кодирует не ошибку, а чистую ценность (value) или состояние. Чем ближе цел, тем выше ценность, тем больше дофамина.
Дальнейшее исследование и дальнейший эксперимент (Kim et al., 2020) был взрывом мозга, ибо мышь поместили в виртуальную реальность. Там сферический беговой трек (по сути, шар, который крутится лапками, как хомячок в колесе, но в 3D), мышь бежит по виртуальной дорожке. Исследователи делают фокус: телепортируют животное в одну и ту же точку, но с разной дистанции.
Если дофамин кодирует просто ценность, то в одной и той же точке сигнал должен быть одинаковым, независимо от того, откуда мышь пришла.
Если дофамин это ошибка предсказания, то чем длиннее был прыжок (че неожиданнее изменение ценности), тем сильнее должен быть всплеск.
Сработал второй вариант. Дофамин бил сильнее именно после длинной телепортации. RPE-гипотеза выстояла.
Но оставался вопрос: почему рампинг есть в навигации, но его практически нет в классических павловских экспериментах (где просто зажигают лампочку и дают еду)?
Ответ, как водится, в деталях. В навигации у животного есть постоянная сенсорная обратная связь (я бегу, столбики мелькают). В павловском опыте между стимулом и наградой — тишина и темнота, и внутренние часы у мозга работают с шумом. Чем дольше тишина, тем выше неопределённость.
Гершман и Микаэль (Mikhael et al., 2022) построили модель, которая показывает, что из-за этой неопределенности возникает систематическое смещение в оценке ценности. И чтобы это смещение скорректировать, мозгу приходится генерировать ненулевые RPE, которые и выглядят как рампинг. Более того, они предсказали, что если во время движения постепенно затемнять картинку (менять сенсорную обратную связь), то рампинг превратится в "бугорок" — что и подтвердилось на практике.
Дофамин глядит по сторонам
Мы привыкли, что дофамин отвечает на награду, но авторы статьи напоминаю, что дофаминовые нейроны стреляют и на новые, неожиданные стимулы, даже если те сами по себе ничего не значат. Это может быть щелчок, вспышка, новый звук.
Классическая теория объясняла это "бонусом за новизну" (Kakade & Dayan, 2002) — мол, мозг оптимистично инициализирует ценности новых объектов, чтобы мы их исследовали. Но новые данные требуют большего.
Например, феномен identity unblocking (Chang et al., 2017). Если крысу научить, что стимул А ведёт к награде, а потом добавить к нему стимул Б, но награду не менять, то Б не вызовет интереса (блокировка). Механизм, известный благодаря Леону Камину и товарищам Рескорле и Вагнеру.
Но если вместо старой награды дать новую, с той же ценностью (например, вместо одной вкусняшки — другую, но такую же вкусную), блокировка снимается. Крыса понимает, что что-то поменялось. И дофамин в этом процессе участвует напрямую — его подавление во время фазы "составного стимула" убивает эффект.
Авторы предлагают концепцию "обобщённой ошибки предсказания". Дофамин сигнализирует не только о том, сколько сахара дали, но и о том, что именно произошло. Это подводит нас к важнейшему выводу: сигнал дофамина — векторный, а не скалярный.
Но если он векторный, как он закодирован в мозге? Варианта предположили два: принцип меченых линий и распределённый код.
Первый предполагает, что разные группы нейронов, дающие проекции в разные зоны, несут разные сообщения. Одни несут ценность, другие — угрозу, третьи — новизну (Menegas et al., 2017; Akiti et al., 2022).
Второй предполагает, что информация перемешана на уровне популяции, и её нужно "демультиплексировать" на местах.
Исследование Stalnaker et al., 2019 показывает, что работает, скорее всего, второй вариант. Информацию о том, какая именно награда выпала (identity), нельзя прочитать из активности одного нейрона — её видно только на уровне ансамбля. Причём видно лишь в начале обучения, пока ошибка предсказания велика.
Пресловутая педаль газа
Меня корёжит от аналогий с педалями газа и тормоза, от аналогий с курьерами и радио, от аналогий с оркестром и дирижёром. Но здесь аналогия буквальная.
Дофамин явно влияет на движение: на иницииацию, скорость и кинематику. Но вписывается ли это в RPE-модель?
Например, активность в проекциях дофамина на дорсальный стриатум не всегда чётко различает типы движений (Markowitz et al., 2023). Это проблема, если мы хотим использовать дофамин для точного выбора действия.
Авторы предлагают изящное решение, ссылаясь на модель Линдси и Литвин-Кумара (Lindsey & Litwin-Kumar, 2022). Идея в том, что дофамин может нести сигнал "сюрприза действия" (action surprise). Если животное сделало что-то маловероятное (с точки зрения его текущей политики, читайте про обучение с подкреплением), дофамин отмечает это событие. Такой сигнал неспецифичен (он не различает, какое именно редкое действие сделано), что объясняет результаты Марковица. И он убывает по мере научения, когда действия становятся автоматическими. А главное — такая модель решает проблему кредита assignmen: как понять, кто виноват, если базальные ганглии предлагали одно, а моторная кора сделала другое?
Экспериментальные данные Гринстрита (Greenstreet et al., 2022 — препринт, но авторы на него ссылаются, а исследование вышло в мае 2025, о чём я писал, но лучше бы не писал; Greenstreet et al., 2025) подтверждают, что в проекциях на хвост стриатума есть нейроны, которые реагируют именно на сюрприз действия, а не на ценность награды.
Так что же такое дофамин?
С одной стороны, авторы показывают, что RPE-гипотеза жива и, если её как следует докрутить (учесть неопределённость, обобщить на сенсорику, добавить сигналы действий), она объясняет очень многое.
С другой стороны, они честно признают: есть вещи, которые RPE-модель в лоб не берёт. Например, теория perceived saliency (Kutlu et al., 2021, 2022). Согласно ей, дофамин в прилежащем ядре реагирует на значимость стимула (произведение физической яркости и "внимательной ценности"), что объясняет, почему на ожидаемую боль нейроны тоже стреляют, а на пропуск боли — стреляют ещё сильнее (потому что отсутствие боли — это новое и неожиданное событие).
Есть и гипотеза ретроспективных выводов (Jeong et al., 2022): дофамин помогает вычислять, что именно стало причиной награды. А есть модель адаптивной скорости обучения (Coddington et al., 2023), где дофамин подкручивает темп обучения в зависимости от того, насколько успешна текущая политика.