Научность психологии. Кризис воспроизводимости, или "А был ли мальчик?"
Публикую перевод отрывка из отчёта NASEM "Reproducibility and Replicability in Science" (2019) о положении психологической науки в вопросе воспроизводимости. Это показательный документ, наиболее важной частью которого (в контексте публикации на Пикабу и обитающих здесь граждан) считаю пункт о неоспоримой пользе психологического знания.
Пока люди, занимающиеся психологической наукой, за скромные копейки делают мир вокруг себя лучше, полоумные неучи продолжают с пеной у рта отстаивать тезисы о ненаучном статусе психологии, называть психологию индустрией обмана и оценивать необходимость добычи психологического знания по результатам жизнедеятельности шарлатанов (и шарлатанок).
Итак, страница 150. Психология.
Идея о существовании «кризиса повторяемости» в психологии получила широкое освещение как в профессиональной, так и в популярной прессе, включая The New York Times, The Atlantic, National Review и Slate. Однако в самом научном сообществе по этому вопросу нет единого мнения. Одни исследователи полагают, что в дисциплине широко распространены нестрогие методы, ставящие под угрозу валидность результатов, – в частности, низкая статистическая мощность, отсутствие чёткого разграничения между априорной и апостериорной проверкой гипотез, а также практика p-хакинга (см., например: Pashler & Wagenmakers, 2012; Simmons et al., 2011). Другие учёные не согласны с такой характеристикой и указывают на издержки, которые, по их мнению, влечёт за собой изображение психологии как науки, находящейся в кризисе, – например, возможный сковывающий эффект подобных заявлений на молодых исследователей, чрезмерный акцент на ошибках первого рода (ложноположительные результаты) в ущерб ошибкам второго рода (ложноотрицательные результаты) и, как следствие, риск не заметить важные новые феномены (Fanelli, 2018; Fiedler et al., 2012). Есть и те, кто напоминает, что психология давно уделяет внимание совершенствованию своей методологии, и нынешнее обсуждение воспроизводимости является частью нормального развития науки. Хороший пример – анализ влияния экспериментатора в 1960‑х годах, который, в частности, стимулировал внедрение двойного слепого метода в экспериментах (Rosenthal, 1979). С этой точки зрения, нынешние опасения следует рассматривать в контексте длительной истории методологических улучшений, по мере того как психологи углубляют понимание и применение статистических и иных методов, а также совершенствуют практику отчётности.
Одним из оснований считать психологию фундаментально состоятельной наукой является тот факт, что она производит большое количество полезного и надёжного знания. Исследователи получают множество повторяемых результатов о причинах человеческих мыслей, эмоций и поведения (Shiffrin et al., 2018). Приведём лишь несколько примеров. Исследования человеческой памяти документально подтвердили ненадёжность свидетельских показаний, что привело к освобождению многих несправедливо осуждённых (Loftus, 2017). Исследования «сверхоправдания» показывают, что поощрение детей за желательные виды деятельности может подорвать их внутреннюю мотивацию к этим занятиям (Lepper и Henderlong, 2000). Исследования того, как формулируются варианты выбора, показали, что больше людей участвуют в социальных программах (например, пенсионных накоплениях или донорстве органов), если их автоматически включают в программу и предоставляют возможность отказаться (opt‑out), по сравнению с ситуацией, когда нужно принять решение о вступлении (opt‑in) (Jachimowicz et al., 2018). Всё чаще исследователи и правительства используют подобные психологические знания для решения социальных задач и проблем, в том числе для повышения эффективности образования, сокращения государственных расходов на неэффективные программы, улучшения здоровья населения и снижения стереотипов и предубеждений (Walton & Wilson, 2018; Wood & Neal, 2016).
Возможно, что наряду с этим прогрессом в психологии наблюдается более низкий уровень повторяемости, чем хотелось бы. Как отмечается на протяжении всего настоящего доклада, ни одна область науки не даёт абсолютно повторяемых результатов, однако было бы полезно оценить текущий уровень повторяемости опубликованных психологических работ и задаться вопросом, соответствует ли он тому уровню, который сама дисциплина считает необходимым. Действительно, психология оказалась на переднем крае эмпирических попыток ответить на этот вопрос с помощью крупномасштабных проектов по повторению, в рамках которых исследователи из разных лабораторий пытались воспроизвести набор исследований (см. Таблицу 5‑1 в Главе 5).
Сами по себе проекты по повторению, однако, оказались спорными, порождая широкие разногласия относительно используемых критериев оценки повторяемости и интерпретации полученных результатов. Одни усматривают в результатах этих проектов повод для тревоги. Например, в своём выступлении перед комитетом Брайан Носек отметил: «Доказательства в пользу воспроизводимости [повторяемости] не достигают того уровня, который можно было бы ожидать или желать» (Nosek, 2018). Исследователи, разделяющие эту точку зрения, приводят ряд аргументов[5].
Во‑первых, многие попытки повторения имели сопоставимый или даже более высокий уровень строгости (например, по объёму выборки, прозрачности, пререгистрации), чем оригинальные исследования, и тем не менее многие из них не смогли воспроизвести исходные результаты (Cheung et al., 2016; Ebersole et al., 2016a; Eerland et al., 2016; Hagger et al., 2016; Klein et al., 2018; O’Donnell и et al., 2018; Wagenmakers et al., 2016). Учитывая высокую степень внимания к работам по повторению (Zwaan et al., 2018), маловероятно, что большинство неудачных повторений объясняются небрежностью в проведении исследований.
Во‑вторых, некоторые попытки повторения были целенаправленно сосредоточены на результатах, которые привлекли к себе большое внимание, вошли в учебники и являются в том или ином смысле «громкими» – то есть на результатах, которые, казалось бы, должны обладать высокой устойчивостью. Часть таких повторений увенчалась успехом, но многие – нет (например, Hagger et al., 2016; O’Donnell et al., 2018; Wagenmakers et al., 2016).
В‑третьих, ряд попыток повторения носили совместный характер, при этом исследователи, тесно связанные с оригинальным результатом (например, авторы исходных работ или специалисты с большим опытом в данной области), принимали активное участие в проверке дизайна и процедуры повторного исследования (Cheung et al., 2016; Eerland et al., 2016; Hagger et al., 2016; O’Donnell и et al., 2018; Wagenmakers et al., 2016). Однако это не привело к стабильно положительным результатам повторений.
В‑четвёртых, когда для неудач при повторении предлагаются возможные объясняющие факторы, они часто носят умозрительный характер и ещё не проверены эмпирически. Например, неудачи при повторении связывают с контекстной чувствительностью и с тем, что некоторые феномены просто труднее воспроизвести в другое время и в другом месте (Van Bavel et., 2016). Однако без перспективных эмпирических проверок этого или других предлагаемых объяснений остаётся реальной возможностью то, что исходный результат в принципе не является повторяемым.
В‑пятых, даже если предположить, что существенная доля (скажем, одна треть) неудачных повторений является ложноотрицательными результатами, это всё равно приводит к выводу, что уровень повторяемости в психологии не достигает идеала. Таким образом, чтобы утверждать, что показатели повторяемости приемлемы (например, близки к 80 %), необходимо быть уверенным, что большинство неудачных повторений имеют существенные недостатки.
Однако другие исследователи придерживаются совершенно иного взгляда на результаты уже проведённых проектов по повторению и предлагают свои аргументы и доказательства. Во‑первых, в некоторых проектах были получены относительно высокие показатели повторяемости: например, Klein et al. (2014) успешно повторили 10 из 13 результатов. Во‑вторых, некоторые громкие проекты (например, Open Science Collaboration, 2015) могли занизить реальный уровень повторяемости из‑за того, что в них не были исправлены ошибки, а также были внесены изменения в процедуру повторения, которых не было в оригинальных исследованиях (см., например: Bench et al., 2017; Etz & Vandekerckhove, 2016; Gilbert et al., 2015; Van Bavel et al., 2016). Более того, выявлен ряд случаев, когда исследования не воспроизводились именно из‑за методологических изменений в повторных экспериментах, а не из‑за проблем с исходными работами; когда эти изменения устраняли, повторение проходило успешно (например, Alogna et al., 2014; Luttrell et al., 2017; Noah et al., 2018). Наконец, остаётся неизвестной обобщаемость результатов самих проектов по повторению, поскольку ни один из них не отбирал исследования для повторения случайным образом, и во многих случаях выбор был достаточно избирательным.
Нерешённым вопросом при любом анализе повторяемости остаётся то, какие именно критерии следует использовать для определения успеха или неудачи. Мета-анализ совокупности результатов может быть более перспективным инструментом для оценки повторяемости, поскольку он позволяет оценить модераторы эффектов, а также однородность результатов. Однако при небольшом числе исследований мета-анализ может не обладать достаточной статистической мощностью.
Несмотря на противоположные взгляды на интерпретацию крупномасштабных проектов по повторению, начинает формироваться консенсус в том, что называть психологию наукой, находящейся в состоянии «кризиса», не является ни полезным, ни обоснованным. Носек выразил это так в своих комментариях для комитета: «Насколько широко распространена проблема воспроизводимости результатов в науке и технике в целом? Простой ответ: мы не знаем. У нас недостаточно информации, чтобы с какой-либо уверенностью дать оценку для какой-то отдельной области или даже для науки в целом». Он добавил: «Мне не нравится термин “кризис”, потому что он подразумевает множество вещей, в которых мы не уверены».
Более того, даже если бы существовала окончательная оценка повторяемости в психологии, никто не знает, каков ожидаемый уровень неповторяемости в здоровой науке. Эмпирические результаты в психологии, как и в науке в целом, по своей природе вероятностны, а это означает, что некоторое количество неудачных повторений неизбежно. Как мы подчёркиваем на протяжении всего доклада, новаторские исследования с большой вероятностью будут давать неоднозначные результаты, поскольку они раздвигают границы знания. Амбициозные исследовательские программы, например, связывающие мозг и поведение, генетические и средовые влияния, вычислительные модели с эмпирическими данными или гормональные колебания с эмоциями, неизбежно приводят к некоторым тупикам и неудачам. Одним словом, некоторые неудачи при повторении могут отражать нормальный прогресс в науке, а также могут указывать на недостаток теоретического понимания или методологические ограничения.
Каков бы ни был масштаб проблемы, научные методы и приёмы анализа данных всегда можно улучшить, и нынешняя дискуссия продолжает давнюю традицию методологических новаций в психологии. Новые практики, такие как проверка эффективности экспериментальных манипуляций, уже стали принятыми в этой области. Заявки на гранты теперь в обязательном порядке включают анализ статистической мощности. В лонгитюдных исследованиях уже не просто констатируют отсев участников, а систематически оценивают его влияние (например, с помощью анализа по принципу «назначенного лечения» – intention‑to‑treat). В то же время не все исследователи внедрили у себя передовые практики, иногда отставая от современного уровня знаний (Sedlmeier & Gigerenzer, 1989). Лишь в последнее время учёные начинают систематически использовать расчёты мощности в исследовательских отчётах и предоставлять открытый доступ к данным и материалам. В последнее десятилетие давление на исследователей с целью улучшения практик и повышения прозрачности усилилось благодаря новым разработкам в области информационных технологий, которые расширяют доступ общественности к информации и возможности для критической оценки науки (Lupia, 2017 ? не уверен в ссылке).
К сожалению, пару исследований не смог добавить, они не на поверхности лежат. Некоторые ссылки оформлены не через doi, а ведут напрямую на сайт журнала, это связано с тем, что псайнет апа я в рот ебал с их ограничениями. При необходимости (по первому запросу) составлю библиографию. Хотя сильно сомневаюсь, что кому-то это надо.
Не забывайте переходить в телегу или, прости хоспаде, мах. Сам уже устал ВПН туда-сюда подрубать, поэтому буду дублировать всякое туда.
