К содержанию
Фонтум Психология Урок 3 / 24 Все уроки

Главная · Курсы · Психология · Программа курса · Модуль I. Основания · урок 3 из 24

Кризис воспроизводимости в психологии

p-значение, размер эффекта, мощность и кризис воспроизводимости

Кризис репликации показал, что заметная часть опубликованных результатов психологии не подтверждается при точном повторении: в проекте RP:P значимый результат дала лишь треть повторений. Корень проблемы в чтении p-значения как «вероятности, что гипотеза верна», хотя оно означает вероятность таких же или более экстремальных данных при верной нулевой гипотезе. На вопрос «насколько» отвечают размер эффекта и доверительный интервал, а не «p < .05».

Harvard PSY 1900 · собственный модуль курса · 45 мин · обновлено 01.10.2026

После урока вы сможете

  • Сказать, что p-значение означает и чего оно не означает, четырьмя точными формулировками
  • Читать размер эффекта и доверительный интервал вместо значимости и сопоставлять величину с бенчмарками области
  • Объяснять, почему малые выборки одновременно не находят реальные эффекты и раздувают найденные
  • Распознавать p-хакинг, HARKing и сад расходящихся тропок по описанию анализа
  • Приводить цифры RP:P и Many Labs и объяснять, почему из них не следует вывод «психология не наука»

Психологические измерения изменчивы. Один и тот же человек в разные дни решает задачу за разное время. Две случайно набранные группы по двадцать человек различаются по любому показателю просто потому, что это разные люди. Вся дальнейшая техника вырастает из одного факта: различие между группами обнаружится всегда, вопрос только в его величине и в том, повторится ли оно.

Самая наглядная демонстрация называется «мёртвый лосось». Мёртвой рыбе предъявляли фотографии людей и обрабатывали её фМРТ-данные стандартным способом, без поправки на множественные сравнения. Получились значимые кластеры «активации». В мозге около 100 000 вокселей, и при пятипроцентной доле ложных срабатываний на каждый воксель значимость где-нибудь найдётся обязательно. Работа писалась как шутка и стала учебным пособием.

Отсюда рамка урока. «Доказано» в психологии означает не свойство одного исследования, а свойство совокупности: величина эффекта, устойчивая при независимом повторении с достаточной мощностью и при заранее объявленном анализе. Каждый элемент этой фразы разбирается ниже отдельно.

Нулевая гипотеза и p-значение

Стандартная процедура называется проверкой нулевой гипотезы на значимость (null hypothesis significance testing, NHST). Устроена она так: сначала формулируют нулевую гипотезу, обычно «эффекта нет». Затем оценивают, насколько наблюдённые данные необычны, если она верна. Само p-значение (p-value) это вероятность получить такие же или более экстремальные данные при условии, что нулевая гипотеза верна.

Из определения следует список того, чем p не является. Это не вероятность того, что нулевая гипотеза ложна. Не вероятность того, что ваша гипотеза верна. Не размер эффекта и не мера его важности. Не вероятность того, что результат воспроизведётся. Заявление Американской статистической ассоциации 2016 года формулирует прямо: p-значение не измеряет ни вероятность гипотезы, ни размер эффекта, и «p < .05» само по себе не основание для содержательного вывода.

Отдельная беда состоит в зависимости от объёма выборки. p зависит от N, поэтому сколь угодно малый эффект становится «значимым» на достаточно большой выборке, а крупный остаётся «незначимым» на маленькой. Порог .05 остаётся конвенцией, а не природной константой, и о его судьбе идёт открытый спор. Одни предлагают сдвинуть порог до .005 для новых открытий, другие обосновывать его отдельно под каждую задачу, третьи отказаться от деления на значимое и незначимое вовсе.

осторожноЧетыре запрещённые фразы

«p = .04, значит гипотеза верна с вероятностью 96 %». «p = .06, значит эффекта нет». «p очень маленькое, значит эффект большой». «Результат значим, значит он воспроизведётся». Каждая из четырёх неверна прямо по определению p.

Размер эффекта и доверительный интервал

Размер эффекта (effect size) отвечает на вопрос, который p не задаёт: насколько велика разница. Cohen's d выражает разницу средних в единицах стандартного отклонения, Hedges' g повторяет ту же идею с поправкой на малые выборки, а r измеряет силу линейной связи. Читать их надо в контексте области, а не по универсальной таблице.

Конвенции Коэна, то есть 0.2, 0.5 и 0.8 как малый, средний и большой, для социальной психологии завышены. Эмпирические ориентиры, посчитанные по самой литературе, дают малый, средний и большой около r = .10 / .25 / .40 и g = 0.15 / 0.40 / 0.70. Отсюда следует неприятное для популярных пересказов. Величина d = 0.3, о которой вы прочтёте как о «существенном влиянии», лежит между малой и средней по меркам области. Такая разница почти всегда невидима в отдельном случае и не даёт права на индивидуальный совет.

Доверительный интервал (confidence interval) полезнее точечной оценки, потому что показывает, каких величин данные не исключают. Возьмём для примера гипотезу, что самоконтроль расходуется как запас топлива и после усилия следующая задача даётся хуже. Её проверили предрегистрированно, в 23 лабораториях по единому протоколу, на 2 141 участнике: d = 0.04 с 95 % интервалом от −0.07 до 0.15. Читать здесь надо не слово «незначимо», а сам интервал. Он исключает ранее заявленную величину около d = 0.62 и совместим только с эффектом, неотличимым от нуля. Сама история и то, что стоит думать о самоконтроле сегодня, разбираются в уроке 19.

Мощность: почему малые выборки лгут в обе стороны

Статистической мощностью (statistical power) называют вероятность обнаружить эффект заданной величины, если он на самом деле есть. Обозначают её 1 − β, где β обозначает вероятность противоположного исхода: эффект есть, а исследование его не находит. Такую осечку называют ошибкой второго рода. Менее очевидное следствие важнее очевидного: при низкой мощности те эффекты, которые всё же прошли порог значимости, систематически завышены. Чтобы получить p < .05 на двадцати участниках, наблюдённая разница обязана быть большой, и в напечатанном виде она большая.

Посчитайте на пальцах, что это значит. Мощность 30 %, обычное дело для психологической работы на малой выборке, означает, что при существующем эффекте вы найдёте его в трёх случаях из десяти. В семи оставшихся вы либо не опубликуете ничего, либо опубликуете что-то другое, найденное по дороге. А те три раза, когда нашли, дадут завышенную оценку величины: слабые проявления эффекта порога не прошли и в литературу не попали. Малая выборка даёт не «менее точный, но такой же» результат. Это систематически другой результат.

В нейровизуализации та же арифметика приводит к резкому выводу. Типичная выборка в исследованиях связи мозга и поведения составляла около 25 человек. На трёх крупнейших наборах данных, суммарно примерно на 50 000 участников, выяснилось, что реальные связи заметно меньше предполагавшихся, а для воспроизводимых оценок нужны тысячи участников. То же самое показали и по нейронауке в целом. Отсюда практическое правило: увидев в статье выборку в несколько десятков человек и крупный эффект, считайте крупный эффект следствием малой выборки, пока не доказано обратное.

на заметкуRanehill et al., 2015

Опыт 2010 года с «позой силы» на 42 участниках нашёл, что две минуты сильной позы поднимают тестостерон и готовность рисковать. Повтор на 200 людях рассчитали так, чтобы эффект такой величины нашёлся с вероятностью больше 95 %. Изменений ни в гормонах, ни в риске он не нашёл. «Маленькое исследование нашло большой эффект» говорит не об удаче, а об ожидаемом устройстве отбора. Требуйте не «значимости», а объёма выборки и обоснования, почему он такой.

Свобода исследователя: как получить любой результат, ничего не подделывая

Гибкость решений исследователя позволяет получить p < .05 практически для любой гипотезы, не искажая ни одного числа. Это показали прямо: взяли заведомо невозможную гипотезу и «доказали» её обычными средствами. Решений по дороге много. Когда остановить сбор данных, какие исходы включить в отчёт, кого исключить как выброс, какие ковариаты добавить, как объединить условия, как преобразовать шкалу. Каждое решение по отдельности выглядит разумно, и именно поэтому механизм работает без злого умысла.

Отсюда два термина. P-хакингом (p-hacking) называют перебор аналитических вариантов до появления значимости. HARKing (hypothesising after the results are known) состоит в формулировании гипотезы после просмотра данных и изложении её как исходной. Их обобщает «сад расходящихся тропок» (garden of forking paths): перебирать варианты сознательно не требуется, достаточно того, что при других данных исследователь принял бы другие решения. Упрёк здесь не в честности, а в том, что заявленная вероятность ошибки перестаёт соответствовать процедуре.

Величину проблемы измерили напрямую. Один и тот же набор фМРТ-данных отдали 70 независимым командам. Ни по одной из девяти проверявшихся гипотез единогласного заключения не вышло: выводы расходились из-за аналитических решений, а не из-за данных. Признак для читателя простой. Чем больше в статье исходов и подгрупп и чем меньше сказано о планах, тем меньше значит найденная значимость.

Публикационное смещение и большие проверки

Публикационное смещение (publication bias) и есть систематический перевес значимых результатов в опубликованной литературе. Его масштаб измерен сравнением форматов. Сопоставили 71 Registered Report, где рецензирование проходит до сбора данных, со 152 обычными статьями. Первая гипотеза подтвердилась в 43,7 % отчётов против 96,1 % в обычной литературе. Разрыв в 52 процентных пункта даёт прямую оценку того, сколько в литературе отбора, а не открытий.

Reproducibility Project: Psychology (Open Science Collaboration, 2015) реплицировал 100 экспериментальных и корреляционных исследований из трёх ведущих журналов с высокой мощностью и по возможности на оригинальных материалах. Значимый результат в оригиналах получен в 97 % случаев, в репликациях в 36 %. Средний размер эффекта упал с r = 0.403 до r = 0.197, то есть вдвое. Оригинальный эффект попал в 95 % интервал репликации в 47 % случаев. По подполям: у когнитивной психологии 50 % успешных репликаций, у социальной 25 %, при сопоставимом снижении размеров эффекта.

Сопоставьте два числа из этих абзацев. Девяносто семь процентов значимых результатов физически невозможны при типичной мощности: даже если бы все гипотезы были верны, а мощность составляла 60 %, значимых оказалось бы около 60 %. Значит, в 97 % виден отпечаток отбора, а не показатель успешности психологии.

Многолабораторные проекты пошли дальше: не одна репликация на находку, а десятки лабораторий по единому протоколу. Many Labs 1: 13 эффектов, 36 выборок, 6 344 участника, воспроизвелись 10 из 13. Many Labs 2: 28 находок, 125 выборок, 15 305 участников, 36 стран, воспроизвелись 15 из 28 при p < .05, медиана d упала с 0.60 до 0.15, а у 9 эффектов направление оказалось противоположным оригиналу. Many Labs 3: надёжно воспроизвелись 3 из 10. Social Sciences Replication Project: 13 из 21 эксперимента из Nature и Science, размеры эффектов около половины от оригинальных.

Три возражения проверены и отклонены. «Другая культура, другая аудитория». Many Labs 2 нашёл значимую неоднородность между выборками лишь в 11 случаях из 28. «Репликаторы не умеют». Many Labs 4 проверял находку по двум протоколам, один из которых согласован с авторами исходной теории, и не нашёл эффекта ни в одном. «Протоколы репликаций были плохие». Many Labs 5 переработал десять непровоспроизведённых находок с экспертным ревью до сбора данных. Прирост составил 0.002 единицы r: медианный r .05 против .04 у прежних протоколов при .37 у оригиналов.

на заметкуReproducibility Project: Psychology, 2015

97 % значимых оригиналов → 36 % значимых репликаций, r 0.403 → 0.197. Неудачная репликация не означает, что оригинал ложен: она совместима и с ложноположительным оригиналом, и с ложноотрицательной репликацией, и с реальным, но меньшим эффектом. Аккуратный вывод скромнее и важнее: опубликованные размеры эффектов систематически завышены, а одиночное исследование не служит доказательством.

Что изменилось: от Bem до Registered Reports

Реформу запустила не отдельная неудачная репликация, а одна публикация. В 2011 году ведущий журнал социальной психологии напечатал девять экспериментов, «доказывающих» способность предвидеть будущее. Стандартам, действовавшим на тот момент, работа соответствовала полностью. Три репликации ключевого эффекта, вышедшие годом позже, оказались неудачными, и журналы поначалу отказывались их печатать. Вопрос, который этот случай поставил перед полем, был не про телепатию: если принятые стандарты позволяют «доказать» предвидение будущего, то что они позволяют доказать про всё остальное?

Ответ оказался институциональным, а не риторическим. Предрегистрация (preregistration), то есть заранее опубликованное описание гипотез, выборки и плана анализа, превращает исследование из поиска в проверку. Registered Reports идут дальше: рецензирование и решение о публикации происходят до сбора данных, поэтому результат не влияет на публикуемость. Сравнение 43,7 % против 96,1 % показывает, что формат меняет распределение результатов, а не только язык статей. Открытые данные делают возможной независимую проверку анализа, а многолабораторные проекты дают недостижимую для одной группы мощность.

И сразу необходимая оговорка. В 2023 году вышла статья, утверждавшая, что высокая воспроизводимость новых социально-поведенческих находок достижима при строгих методах. Её отозвали 24 сентября 2024 года. По редакционной ноте: непрозрачность и неверное изложение гипотез и предсказаний, отсутствие предрегистрации мер и анализов при заявлении о предрегистрации, выбор показателей и анализов после просмотра данных, неполное сообщение данных. Авторы согласились с отзывом в части неверных утверждений о предрегистрации.

Это не аргумент против реформ, а аргумент в пользу того, что заявление о предрегистрации надо проверять. Проверка дешёвая: протокол открыт, и его можно сравнить с текстом статьи и увидеть, совпадают ли гипотезы, исходы и правила исключения.

осторожноProtzko et al., 2023, отозвана в 2024

Работа, доказывавшая, что строгие методы обеспечивают высокую воспроизводимость, отозвана в том числе за ложное заявление о предрегистрации. Вывод не в том, что реформы не работают, а в том, что слово «предрегистрация» в тексте статьи это ссылка, которую надо открыть.

Что надёжно воспроизводится и как читать статью

Вывод «психология вообще не наука» из всего перечисленного не следует, и это не утешение, а следствие данных. Часть находок выдержала десятки прямых репликаций, а в многолабораторных проектах воспроизвелась во всех выборках подряд, причём с эффектами крупнее, чем у большинства проваленных. Такие находки в курсе помечены в реестре статусом «выдержало», и встречаться они будут не списком, а в тех уроках, где явление вводится и объясняется. Приговор без знакомства с подсудимым ничему не учит.

А научить здесь можно другому, различать устройство. Надёжная находка узнаётся по пяти признакам: крупный размер эффекта, простая и сильная манипуляция, объективное измерение исхода, десятки прямых репликаций, теория, предсказывающая границы явления. Рухнувшая устроена обратно: малая выборка, тонкая манипуляция, самоотчёт как исход, «концептуальные» репликации вместо прямых, теория, объясняющая любой результат. Различие систематическое, а не случайное. Именно оно позволяет калибровать доверие ещё до того, как появятся репликации, и именно его вы будете прикладывать к каждой теме курса.

Нужна и вторая оговорка, против противоположной крайности. «36 % психологии не воспроизводится» это вульгаризация. Это доля значимых репликаций для выборки из трёх журналов, а сам критерий успеха произволен, и вокруг него был содержательный спор с ответом авторов проекта. Единого определения «успешной репликации» нет: значимость, попадание в доверительный интервал и эквивалентность размеров эффекта дают разные цифры.

Порядок чтения статьи, который стоит закрепить на весь курс. Первое: объём выборки и чем он обоснован. Второе: размер эффекта с доверительным интервалом, а не p. Третье: сколько исходов измерено и что из этого объявлено заранее. Четвёртое: прямые репликации, есть ли они, кем сделаны, что дали. Пятое, и только после этого: содержательное объяснение авторов. Заголовок и обсуждение читайте последними: там больше всего свободы и меньше всего данных.

Лаборатория · методология

Сад расходящихся тропок

Перед вами настоящий набор данных, который сгенерирован так, что истинной разницы между группами НЕТ: обе выборки взяты из одного распределения. Ваша задача всё равно получить p < 0,05. Крутите настройки анализа, как это делает исследователь, которому нужен результат.

Открыть тренажёр

Ключевые исследования

Open Science Collaboration2015100 репликаций из трёх ведущих журналов: 97 % значимых оригиналов против 36 % значимых репликаций, средний r упал с 0.403 до 0.197.
Klein et al. (Many Labs 2)201828 находок, 125 выборок, 15 305 участников, 36 стран: 15 из 28, медиана d 0.60 → 0.15. Вариативность объясняется эффектом, а не страной.
Ebersole et al. (Many Labs 5)2020Экспертная доработка протоколов до сбора данных дала прирост 0.002 единицы r, так что провалы репликаций не объясняются плохим исполнением.
Scheel, Schijen & Lakens202171 Registered Report против 152 обычных статей: первая гипотеза подтвердилась в 43,7 % против 96,1 %, что даёт прямую оценку публикационного смещения.
Simmons, Nelson & Simonsohn2011Researcher degrees of freedom: гибкость аналитических решений позволяет получить p < .05 почти для любой гипотезы без подделки данных.
Ritchie, Wiseman & French2012Три неудачные репликации эффекта предвидения из Bem (2011). Журналы поначалу отказывались их публиковать, и с этого кейса началась реформа.
Hagger et al.2016Предрегистрированная многолабораторная проверка гипотезы истощения самоконтроля: 23 лаборатории, 2 141 участник, d = 0.04 с 95 % интервалом от −0.07 до 0.15.
Botvinik-Nezer et al.2020Один набор фМРТ-данных отдали 70 независимым командам: ни по одной из девяти гипотез единогласного заключения не вышло. Расхождение создают аналитические решения.

Что подтвердилось, а что нет

отвергнутоЗначимый результат, опубликованный в ведущем журнале, это установленный факт.

Reproducibility Project: Psychology повторил 100 исследований из трёх ведущих журналов: 97 % значимых оригиналов против 36 % значимых репликаций, средний размер эффекта r упал с 0.403 до 0.197, оригинальный эффект попал в 95 % интервал репликации в 47 % случаев. Корректная формулировка: одиночное исследование не является доказательством, а опубликованные размеры эффектов систематически завышены. При этом «36 % психологии не воспроизводится» остаётся вульгаризацией: это доля значимых репликаций для конкретной выборки из трёх журналов, и сам критерий успеха произволен.

отвергнутоПровалы репликаций объясняются тем, что репликаторы работали хуже оригинальных авторов или в других условиях.

Возражение проверено тремя способами и не подтвердилось. Many Labs 5 переработал десять непровоспроизведённых находок RP:P с формальным экспертным ревью протоколов до сбора данных, и прирост составил 0.002 единицы r, медианный r .05 против .04 у прежних протоколов при .37 у оригиналов. Many Labs 4 проверил находку по двум протоколам, один из которых согласован с авторами исходной теории, и не нашёл эффекта ни в одном. Many Labs 2 нашёл значимую неоднородность между выборками лишь в 11 случаях из 28: страна и способ сбора данных почти ничего не предсказывают.

сильно ослабленоЕсли в статье написано «предрегистрировано», результат получен именно так, как заявлено.

Формат работает: в Registered Reports первая гипотеза подтверждается в 43,7 % случаев против 96,1 % в обычной литературе, то есть предрегистрация действительно меняет распределение результатов. Но заявление о предрегистрации не то же самое, что предрегистрация. Статью 2023 года о высокой воспроизводимости при строгих методах отозвали в сентябре 2024-го в том числе за отсутствие предрегистрации мер и анализов при заявлении о ней и за выбор показателей после просмотра данных. Правильная практика состоит в том, чтобы открыть протокол и сравнить его с текстом статьи.

Термины

нулевая гипотезаnull hypothesis
Предположение об отсутствии эффекта, относительно которого оценивается необычность данных. Проверяется, но не «доказывается».
p-значениеp-value
Вероятность получить такие же или более экстремальные данные при условии, что нулевая гипотеза верна. Не вероятность гипотезы.
размер эффектаeffect size
Мера величины различия или связи (d, g, r), не зависящая от объёма выборки. Отвечает на вопрос «насколько», а не «есть ли».
доверительный интервалconfidence interval
Диапазон величин, совместимых с данными. Показывает, какие значения эффекта данные исключают.
статистическая мощностьstatistical power
Вероятность обнаружить эффект заданной величины, если он существует, то есть 1 − β. При низкой мощности найденные эффекты завышены.
p-хакингp-hacking
Перебор вариантов анализа (исходов, подвыборок, исключений, момента остановки набора) до появления значимого результата. Свободой исследователя (researcher degrees of freedom) называют сам набор таких развилок, а p-хакингом её использование, обычно без умысла.
HARKinghypothesising after the results are known
Формулирование гипотезы после просмотра данных и изложение её как исходной.
публикационное смещениеpublication bias
Систематический перевес значимых результатов в литературе из-за того, что незначимые реже отправляют и реже принимают.
предрегистрацияpreregistration
Опубликованное до сбора данных описание гипотез, выборки и плана анализа. Отделяет проверку от поиска.
прямая репликацияdirect replication
Повторение процедуры оригинала настолько точно, насколько возможно, с достаточной мощностью и заранее объявленным анализом. Только она проверяет исходное утверждение. Изменённая версия проверяет уже другое.

Практикум · Получите значимый результат из чистого шума

Пока p-хакинг остаётся словом, он выглядит как обвинение в недобросовестности. Сделав его своими руками на случайных числах, вы увидите, что обмана не требуется, достаточно нескольких разумных решений подряд. Нужны электронная таблица и 30-40 минут.

  1. Создайте два столбца по 20 случайных нормально распределённых чисел, «контрольную» и «экспериментальную» группы. По построению никакого эффекта в данных нет. Добавьте ещё пять таких пар: считайте, что вы измерили шесть исходов, а именно настроение, внимание, скорость, точность, уверенность, самооценку.
  2. Для каждой пары посчитайте t-тест и p. Запишите, сколько исходов из шести дали p < .05.
  3. Если не дал ни один, добавьте по 10 наблюдений в каждую группу и пересчитайте. Повторяйте, пока значимость где-нибудь не появится, и запишите, сколько шагов понадобилось. Затем случайно пометьте половину строк как «женщины» и пересчитайте все исходы отдельно по двум подгруппам, посчитав суммарное число выполненных тестов.
  4. Напишите одно предложение в стиле аннотации о самом сильном найденном результате, правдиво, не упоминая остальных тестов. Это HARKing в готовом виде. Сохраните эту фразу.
  5. Оцените, что было бы, если бы вы объявили шесть исходов и обе подгруппы заранее: сколько тестов вы фактически провели и какой порог значимости следовало бы применять. Затем пройдите тренажёр урока и сравните собственные результаты с его сценариями.

Вопросы для самопроверки

Вопрос 1

Исследование сообщает: разница между группами значима, p = .01. Что это значит?

  • Вероятность того, что гипотеза исследователя верна, равна 99 %, а вероятность ошибки 1 %
  • Эффект достаточно велик, чтобы иметь практическое значение: чем меньше p, тем крупнее различие
  • Вероятность получить такие же или более экстремальные данные, если эффекта нет, равна 1 %
  • Результат воспроизведётся примерно в 99 % повторных исследований: p и есть вероятность повторения
Вопрос 2

Почему из двух исследований одного эффекта опубликованный результат на 40 участниках чаще завышает эффект, чем результат на 400?

  • На малой выборке измерения каждого участника точнее, потому что экспериментатор работает с каждым внимательнее
  • На малой выборке легче контролировать конфаунды: участников меньше, различия между ними тоже
  • Малые выборки чаще используют объективные измерения, а объективная мера сама по себе увеличивает наблюдаемую разницу
  • На малой выборке порог значимости может пройти только большая наблюдённая разница
Вопрос 3

В социально-психологическом исследовании получена связь r = .12 на большой выборке, доверительный интервал узкий. Как это корректно прочитать?

  • Эффект малый по эмпирическим бенчмаркам социальной психологии
  • Эффект средний: r = .12 приходится примерно на середину конвенций Коэна
  • Эффект большой: интервал очень узкий, а значит связь сильная и надёжная
  • Величину r без p-значения интерпретировать нельзя
Вопрос 4

Автор оригинального исследования отвечает на неудачную репликацию: «протокол воспроизвели неаккуратно». Какие данные проверяют это возражение напрямую?

  • Many Labs 2: те же находки, проверенные в 36 странах и на разных аудиториях
  • Many Labs 5: переработка протоколов с экспертным ревью до сбора данных
  • Reproducibility Project: Psychology: 100 прямых репликаций из трёх ведущих журналов
  • Scheel et al. (2021): доля подтверждённых гипотез в Registered Reports против обычных статей
Вопрос 5

В статье измерено 14 исходов, значимым оказался один (p = .03), ссылки на предрегистрацию нет, а в обсуждении именно этот исход подан как исходно проверявшаяся гипотеза. Что здесь наиболее вероятно?

  • Ошибка II рода: остальные 13 исходов измерены недостаточно мощно, поэтому и оказались незначимыми
  • Конфаунд: значимый исход связан с посторонней переменной, которую в работе не учли
  • Множественные сравнения плюс HARKing: гипотеза сформулирована после данных
  • Проблемы нет: один значимый исход из четырнадцати это обычный результат, и заявлять его как проверявшуюся гипотезу допустимо

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Stangor, Introduction to Psychology, гл. 2 «Psychological Science»: Формальная часть, которую этот урок предполагает известной: выборка, значимость, размер эффекта, базовые дизайны.
  • Marcus (ред.), The Norton Psychology Reader: Stanovich, «How to Think Straight about Psychology», с. 27-37: Назначено к первой лекции Yale PSYC 110. Методологическое введение, к которому полезно вернуться уже после этого урока.
  • Gross, Schmader, Hard & Anderson, Interactive Psychology: People in Perspective: Учебник Berkeley PSYCH 1 и летнего Yale PSYC 110. Независимый второй пересказ тех же понятий, с встроенными квизами и виртуальными лабораториями.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Психология»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?