Социально-психологические эксперименты: что подтвердилось
Из 91 утверждения курса проверку выдержали 28, и у знаменитого опыта судьба почти всегда двойная: одна его часть устояла, другая рухнула
Знаменитые социально-психологические эксперименты, от Аша и Милгрэма до 36 вопросов Арона, проверку выдержали частично: из 91 утверждения о них устояли 28. Отвергнуты 22, сильно ослаблены 16, у 13 статус «не было доказательством», а у 12 спор открыт. У знаменитого опыта судьба почти всегда двойная: одна его часть устояла, другая рухнула. Ошибки нашли в основном сами психологи, многолабораторными повторами и архивами.
Собран по реестрам уроков 1-23 курса, новых исследований урок не вводит · 27 мин · обновлено 01.10.2026
После урока вы сможете
- Называть, сколько утверждений курса выдержало проверку, сколько отвергнуто и почему эти доли нельзя читать как оценку всей науки
- Приводить примеры выдержавших результатов: фасилитация и леность, минимальные группы, групповая поляризация, контакт, эффект прожектора
- Разбирать на примерах курса пять причин, по которым рушились знаменитые результаты
- Проверять новость о психологическом эффекте по паспорту, размеру, судьбе и статусу
- Объяснять, как сами психологи нашли ошибки: многолабораторными повторами, архивами и зарегистрированными отчётами
Студент Иллинойсского университета держит в зубах ручку и оценивает комиксы Гэри Ларсона по шкале от 0 до 9. Ему сказали, что изучают, как люди с травмами учатся держать ручку ртом. На деле ручка в зубах заставляет мышцы лица работать примерно как при улыбке. Другие участники держат её губами, и лицо складывается, как при надутых губах. Так в 1988 году Штрак, Мартин и Штеппер проверяли, меняет ли выражение лица переживаемую эмоцию.
В опыте было 92 студента. «Губы» оценили комиксы в среднем в 4,32 балла, «зубы» в 5,14. Разница в 0,82 балла прошла порог значимости только по одностороннему критерию, p = 0,03. Опыт вошёл в учебники как классика. В 2016 году его решили проверить сразу в семнадцати лабораториях, и план проверки журнал одобрил до сбора данных.
Проверку вёл Вагенмакерс с соавторами, в анализ вошли 1 894 участника. Вместо 0,82 балла разница вышла 0,03, интервал от −0,11 до 0,16. Во всех 17 лабораториях данные лучше объясняла гипотеза «эффекта нет». Но на этом история не кончилась. В 2022 году проверку Many Smiles прошли 3 878 человек из 19 стран, и среди её авторов был сам Штрак. Ручка во рту прибавила радости 0,04 балла по шкале от 1 до 7, улыбка по инструкции 0,40, подражание улыбке 0,49.
Одна знаменитая идея дала два ответа. Утверждение про ручку в зубах в исходной силе отвергнуто. Утверждение, что намеренная улыбка немного усиливает радость, выдержало: метаанализ, то есть сводный расчёт по 138 исследованиям, даёт d = 0,20. Здесь d показывает, на какую долю обычного разброса между людьми разошлись средние двух групп. Так курс разобрал каждый знаменитый опыт, от Аша до 36 вопросов Арона, а этот урок сводит 23 урока на одну карту.
Карта курса в числах
В каждом уроке курса стоял реестр: три-четыре утверждения в той форме, в какой их пересказывают, и статус каждого по данным проверок. Статус ставится утверждению, а не опыту и не человеку. В уроках 1-23 таких утверждений 91. Выдержали проверку 28, отвергнуты 22, сильно ослаблены 16. Ещё 13 получили статус «не было доказательством», а у 12 спор открыт. Статус «миф» в этих уроках не понадобился ни разу.
Если сложить выдержавшие и сильно ослабленные, выйдет 44 из 91. За этими утверждениями стоит настоящий эффект, хотя у 16 из них он меньше обещанного или живёт только в узких условиях. Отвергнуто примерно каждое четвёртое утверждение. Статус «не было доказательством» значит другое: опыт по своему устройству не мог дать приписанный ему вывод. Обратного он при этом тоже не доказал.
Читать эти доли как оценку всей науки нельзя, потому что реестр перекошен к пересмотрам по построению. Уроки выбраны по знаменитым историям и поисковым запросам, а знаменитыми часто становятся громкие и хрупкие результаты. Утверждения записаны так, как их пересказывают, а пересказ обычно смелее данных. Поэтому 28 из 91 это доля выдержавшего среди знаменитого и пересказанного, а не среди всего, что измерила социальная психология.
Что выдержало
Список выдержавшего длинный, и он собран из тех же уроков. Присутствие других ускоряет простую работу и замедляет сложную: это видно по 241 исследованию и по предрегистрированному повтору опыта Триплета на 445 детях. Когда вклад каждого не виден, люди стараются меньше, и метаанализ 78 исследований даёт d = 0,44. Обсуждение в группе единомышленников сдвигает общую позицию дальше в сторону исходного уклона, и это держится полвека проверок.
Деления на группы по пустяку хватает, чтобы отдавать своим больше: 137 проверок в метаанализе Маллена и соавторов. Контакт между группами снижает предубеждение, и в 24 из 27 рандомизированных проверок результат положительный. Привлекательным людям приписывают больше хороших качеств, это держится в метаанализах. В лаборатории отдельный человек при других помогает реже и позже, по метаанализу на 7 700 с лишним участниках. Выдержал и эффект простого предъявления: симпатия растёт от одних повторных встреч, хотя после многих показов снова падает.
Эффект прожектора выдержал концептуальные повторы. В исследовании Гиловича и соавторов 2000 года 15 студентов Корнелла надевали футболку с немодным певцом и ждали, что её заметят 46 % наблюдателей. Заметили 23 %. Устояло и ядро самых знаменитых опытов. Единодушное неверное большинство сдвигает ответы части людей: в повторе 2023 года в Берне 33 % неверных ответов. После первых протестов жертвы продолжали 28 человек из 40 в повторе Бургера.
У выдержавшего есть общие черты. Утверждения узкие: не «люди конформисты», а «единодушное большинство сдвигает публичные ответы части людей в простой задаче». Их проверяли много раз и разные группы исследователей. А эффекты почти всегда малые или умеренные. У минимальных групп без взаимной зависимости d = 0,19, фасилитация объясняет от 0,3 до 3 % разброса, сравнение с соседями на 600 000 домах сократило расход электричества на 2 %. Выдержать проверку и быть большим это разные вещи.
Курс проследил судьбу 91 утверждения о знаменитых опытах, многие из которых поставлены на студентах западных университетов и мерили исход в тот же день. Отсюда не следует, какая доля всей социальной психологии верна: утверждения отобраны по славе опыта и записаны в форме пересказа, а не взяты случайно. Не следует и того, что выдержавшие эффекты одинаковы в любой культуре и держатся годами: большинство проверок мерили минуты и дни, а спор о роли культуры выборки в уроке 2 остался открытым.
Почему рушились результаты: выборка и подсчёт
Первая причина малые выборки. В опыте о позе силы было 42 человека, и после двух минут в «сильной» позе на риск пошли 86 % против 60 %. Повтор Ранехилл и соавторов на 200 людях не нашёл изменений ни в гормонах, ни в риске. В опыте Кройла и Купера 1983 года, который взяли за основу проверки диссонанса, было по 10 человек в условии и d = 2,40. Проверка Вайдиса и соавторов 2024 года на 3 822 людях нашла для свободного выбора d = −0,03.
При малой выборке случайная удача легко выглядит открытием. Удачи к тому же печатают охотнее, и это называют публикационным смещением. Сводка 2010 года о жестоких видеоиграх давала в лучших экспериментах r = 0,21. Здесь r показывает силу связи: 0 значит, что связи нет, 1 полную связь. Хилгард и соавторы пересчитали те же данные и нашли, что в неопубликованных диссертациях связь была r = 0,01.
Вторая причина гибкость меры и анализа. Агрессию в лаборатории часто мерят громкостью шума, который участник назначает «сопернику». Эльсон с соавторами в 2014 году насчитали не меньше 13 способов свести эти числа к одной оценке. На данных трёх их опытов разные способы давали рост, снижение или отсутствие эффекта жестокой игры. Карни, первый автор опыта о позе силы, в 2016 году сама перечислила свои выборы: выборку набирали порциями, а тест для риска взяли с p = 0,05 вместо соседнего с p = 0,052.
Выборы при сборе и анализе данных, которые незаметно подгоняют результат, называют свободой исследователя. Подделки в этом нет, есть решения, принятые после взгляда на данные. Против них поле придумало предрегистрацию: план опыта и анализа публикуют до сбора данных. Нули о видеоиграх и о позе силы получены именно в таких проверках.
Не тот исход, чужая рука, пересказ
Третья причина вмешательство исследователя в ход опыта. В 2019 году Ле Тексье нашёл в архиве Стэнфордского тюремного эксперимента инструктаж охранников 14 августа 1971 года. Записана была меньше чем десятая часть из примерно 150 часов опыта. Хаслам, Райхер и Ван Бавел разобрали разговор, где ассистент Джаффе требует от мягкого охранника жёсткости. В лагере Робберс-Кейв, по архивам Перри, персонал подкручивал счёт турнира.
Опыт с одним условием, где исследователь сам подталкивает события, может быть яркой демонстрацией, но причину доказать не может. Сдвигает результат и простое ожидание. В опыте Дуайена и соавторов 2012 года медленная походка после слов о старости появлялась там, где замедления ждал экспериментатор, и это фиксировали даже датчики. Такое искажение называют эффектом ожиданий экспериментатора.
Четвёртая причина подмена исхода. Дети в опыте Бандуры, Росса и Росс 1961 года били надувную куклу Бобо, игрушку для ударов, а пересказ превратил это в агрессию к людям. 36 вопросов Арона мерили ощущение близости после 45 минут разговора, а эссе в New York Times пересказало их как способ влюбиться. Уиллис и Тодоров сравнивали быстрые оценки лица с неторопливыми оценками других людей, а не с характером человека на фото.
Пятая причина пересказ вместо данных. Мэннинг, Левин и Коллинз в 2007 году разобрали судебные документы по убийству Китти Дженовезе. На суде выступили пятеро жильцов, удара ножом не видел никто, а все десять разобранных учебников пересказывали историю о 38 свидетелях. По 99 учебникам вывод о «стадности» из опытов Аша тоже родился в пересказах, хотя в его данных две трети ответов верные. Числа Вайкери о коле и попкорне существовали только в пресс-релизах.
Незначимая разница на малой выборке отсутствия эффекта не доказывает. В опыте Дарли и Бэтсона 1973 года на 40 семинаристах притча о самаритянине дала 53 % помогших против 29 %, разница незначима, и вывод «притча не влияет» из этих данных не следует. Другое дело проверка на тысячах людей по заранее записанному плану с узким интервалом вокруг нуля, как у ручки в зубах: от −0,11 до 0,16 балла.
Где спор открыт
Двенадцать утверждений курса остались со статусом «спор открыт». Это нормальное состояние проверки: у обеих сторон есть данные, и они не сходятся. Уроки называют, чего в каждом споре не хватает, и отсюда видно, какие данные могли бы его закрыть.
Опыт на качающемся мосту Капилано держится на 9 звонках из 18 против 2 из 16, без случайного распределения людей по мостам. Пересчёт по числам статьи для второго опыта даёт p = 0,113. Закрыть спор мог бы опыт, где условия назначает жребий, на выборке в разы больше. О карточках про полотенца в отелях данные из двух стран расходятся. В США норма «так делают другие гости» дала 44,1 % повторного использования против 35,1 %, в Германии 81,9 % против 83,7 % у обычной карточки. Здесь нужна одна проверка по общему протоколу во многих странах.
Неясно и то, снизился ли конформизм со времён 1950-х годов. Перрин и Спенсер в 1981 году получили у британских студентов одну уступку на 396 проб, а повтор 2023 года в Берне дал 33 %, почти как у Аша. Бернский повтор шёл без предрегистрации, и крупная проверка по заранее записанному плану ответила бы лучше. В споре о бескорыстной помощи группы Бэтсона и Чалдини расходятся в том, что учитывать в расчёте. В споре о точности стереотипов ответ зависит от того, какой стереотип взят и что считать критерием.
Близко к спору стоят жестокие видеоигры, хотя их статус «сильно ослаблено». Сводка 2010 года давала r = 0,21, зарегистрированный отчёт на 1 004 британских подростках дал 0,01. Теперь спорят о величине от нуля до примерно 0,1. Спор, сжатый от «причинного фактора риска» до такой узкой полосы, тоже результат проверки.
Как читать новость о новом эффекте
Итоговый навык курса помещается в четыре вопроса, и их можно задать любой новости вида «психологи доказали». Первый вопрос о паспорте опыта: на ком мерили, сколько было людей, с чем сравнивали и что считали исходом. Исход проверяется отдельно, потому что подмена исхода дала курсу больше всего мифов. Кукла вместо людей и близость вместо любви выглядят мелочью, пока не прочитан заголовок.
Второй вопрос о размере. «Эффект значим» без числа ничего не говорит о величине. Размер эффекта называют числом, d или r, а лучше переводят в людей: 28 из 40 понятнее, чем 70 %. Крупный эффект на малой выборке настораживает. В сводке Палак и соавторов 2021 года у самых мелких исследований d = 0,61, а у самых крупных 0,19.
Третий вопрос о судьбе: повторяли ли опыт, кто, на скольких людях и по заранее объявленному ли плану. Отсутствие повтора не равно подтверждению. Больше всего весит прямая репликация, то есть повтор по тем же процедурам на новых людях. Ещё весомее многолабораторная репликация, где один заранее записанный протокол сразу проходят многие лаборатории. Такой же вес у зарегистрированного отчёта, где журнал одобряет план до сбора данных.
Четвёртый вопрос о статусе: какой из шести статусов подходит утверждению заголовка, а не опыту целиком. Заголовок полезно сверить с выводом самих авторов. Арон и соавторы писали, что их процедура вряд ли создаёт верность и обязательства, а заголовок эссе обещал способ влюбиться в любого. У свежего одиночного опыта честный ответ часто такой: статуса пока нет, есть один результат и нет повтора.
Кто нашёл ошибки
Ошибки в знаменитых опытах нашли не критики со стороны, а в основном сами психологи. Проект Open Science Collaboration, 270 соавторов, в 2015 году повторил 100 исследований. Из 97 значимых результатов значимыми остались 35, а в социальной психологии воспроизвелись 14 эффектов из 55. Many Labs 1 проверил 13 эффектов в 36 выборках и подтвердил 10. Many Labs 2 проверил 28 находок в 125 выборках из 36 стран и подтвердил 15, а медиана d упала с 0,60 до 0,15.
Вторым инструментом стали архивы. Хаслам, Лохнан и Перри свели всю программу Милгрэма в одну таблицу: до конца дошли 323 человека из 740, а не 65 %. Ле Тексье поднял документы Стэнфордского опыта, Перри записи лагеря Робберс-Кейв. Экономисты Левитт и Лист нашли потерянные данные опытов с освещением в Хоторне. Хилгард и соавторы получили данные сводки о видеоиграх от самого Андерсона.
Часть пересмотров сделали авторы оригиналов. Карни в 2016 году отказалась от вывода о позе силы, Штрак вошёл в число авторов Many Smiles, Конрат с соавторами сами нашли, что падение эмпатии после 2009 года сменилось ростом. Изменился и порядок работы. В обычных статьях первая гипотеза подтверждалась в 96 % случаев, в зарегистрированных отчётах в 44 %, хотя эти данные наблюдательные. Пересмотрен не эксперимент как способ знать, а уверенность, с которой из малых чисел выводили законы о людях.
Ключевые эксперименты
| Штрак, Мартин и Штеппер | 1988 | Эксперимент на 92 студентах Иллинойсского университета: с ручкой в зубах комиксы оценили в 5,14 балла, с ручкой в губах в 4,32 по шкале от 0 до 9, односторонний p = 0,03. Во втором опыте на 83 студентах Мангейма эффект только для вопроса, насколько весело. |
| Вагенмакерс и соавторы | 2016 | Зарегистрированный отчёт о репликации опыта с ручкой в 17 лабораториях, 1 894 участника: разница 0,03 балла вместо 0,82, интервал от −0,11 до 0,16, все байес-факторы на стороне нуля. |
| Коулз и соавторы (Many Smiles) | 2022 | Состязательная коллаборация, 3 878 участников из 19 стран, 1 504 в главном анализе. Прибавка радости по шкале от 1 до 7: подражание улыбке 0,49, улыбка по инструкции 0,40, ручка во рту 0,04. |
| Open Science Collaboration | 2015 | 100 прямых репликаций работ 2008 года из трёх журналов: значимы 35 из 97 повторов, средний r 0,403 в оригиналах и 0,197 в повторах. В социальной психологии воспроизвелись 14 эффектов из 55, в когнитивной 21 из 42. |
| Кляйн и соавторы | 2018 | Many Labs 2: 28 находок, 125 выборок, 15 305 участников из 36 стран и территорий. Воспроизвелись 15 из 28, медиана d 0,60 в оригиналах и 0,15 в повторах, разброс между WEIRD и менее WEIRD выборками мал. |
| Эльсон с соавторами | 2014 | Разбор задачи конкурентного времени реакции: не меньше 13 способов подсчёта агрессии. На данных трёх своих опытов разные способы давали рост, снижение или отсутствие эффекта жестокой игры. |
| Ле Тексье | 2019 | Разбор архива СТЭ: сотни документов, 6 часов видео, 48 часов аудио, телефонные интервью с 15 участниками в 2017 году. Найдены инструктаж охранников 14 августа, происхождение опыта из Toyon Hall и запись меньше 10 % из примерно 150 часов. |
| Мэннинг, Левин и Коллинз | 2007 | Разбор судебных документов по убийству Китти Дженовезе и десяти учебников. На суде выступили пятеро жильцов, удара ножом не видел никто, нападений было два, второе в подъезде. Все десять учебников пересказывают историю о 38 свидетелях. |
Что подтвердилось, а что нет
Верна узкая форма. Open Science Collaboration 2015 года: в социальной психологии воспроизвелись 14 эффектов из 55, средний r упал с 0,403 до 0,197. Но Many Labs 1 (2014) подтвердил 10 эффектов из 13 в 36 выборках, Many Labs 2 (2018) 15 из 28 в 125 выборках, Камерер и соавторы 2018 года 13 из 21. В реестрах уроков 1-23 из 91 утверждения выдержали 28 и ещё 16 сильно ослаблены, то есть эффект у них есть. Заметная часть знаменитых результатов не повторяется, а повторившиеся при честном повторе меньше опубликованных.
В курсе у большинства знаменитых опытов судьба двойная. Кукла Бобо: подражание новым действиям выдержало (22 из 24 детей агрессивного условия), вывод о насилии к людям доказательством не был. Милгрэм: продолжение после первых протестов выдержало (28 из 40, 72 из 80, 50 из 58), «65 процентов до конца» отвергнуто (323 из 740 по всей программе). Аш: сдвиг публичных ответов выдержал, «большинство конформисты» отвергнуто, две трети ответов верные. Лицевая обратная связь: ручка в зубах отвергнута (0,03 балла вместо 0,82), намеренная улыбка выдержала (d = 0,20 по 138 исследованиям).
Выдержавшие эффекты курса в основном малые или умеренные. Намеренная улыбка: d = 0,20, в Many Smiles прибавка 0,40-0,49 балла по шкале от 1 до 7. Сравнение с соседями в счетах: −2,0 % на 600 000 домохозяйств (Олкотт 2011). Фасилитация: от 0,3 до 3 % разброса (Бонд и Титус 1983). Минимальные группы без взаимной зависимости: d = 0,19 (Баллиет и соавторы 2014). Ожидания учителя: r около 0,1-0,2. Контакт лицом к лицу: d = 0,28 по 28 экспериментам (Палак и соавторы 2021). Крупнее социальная леность, d = 0,44, но после удаления выбросов 0,24.
Многолабораторные и прямые повторы: Open Science Collaboration 2015 года (270 соавторов, 100 повторов), Many Labs 1 и 2 (36 и 125 выборок), проверка ручки в зубах в 17 лабораториях (Вагенмакерс и соавторы 2016), проверка диссонанса в 39 лабораториях (Вайдис и соавторы 2024). Переанализы и архивы: Хилгард и соавторы 2017 по данным Андерсона, «Мета-Милгрэм» Хаслама, Лохнана и Перри 2014, Перри 2014 о Робберс-Кейв. Авторы оригиналов: Карни 2016, Штрак в Many Smiles 2022, Конрат и соавторы 2023. Оговорка: данные Хоторна нашли экономисты Левитт и Лист, а архивный разбор книги о секте Мэриан Кич сделал независимый исследователь Келли.
Термины
- размер эффектаeffect size
- Насколько велико различие или связь, в отличие от вопроса, есть ли они вообще. Выражается числом: r, d Коэна, разностью долей.
- метаанализmeta-analysis
- Статистическое объединение результатов многих исследований в одну оценку эффекта.
- публикационное смещениеpublication bias
- Неравная публикация значимых и незначимых результатов, из-за которой метаанализ завышает эффект.
- прямая репликацияdirect replication
- Повторение исследования по тем же процедурам на новой выборке.
- многолабораторная репликацияmulti-lab replication, Many Labs
- Один заранее записанный протокол, который одновременно проходят многие лаборатории в разных странах.
- предрегистрацияpreregistration
- Публикация плана опыта и анализа до сбора данных. Отрезает возможность подгонять анализ под результат.
- зарегистрированный отчётregistered report
- Формат статьи, где план и анализ одобряются журналом до сбора данных.
- свобода исследователяresearcher degrees of freedom
- Выборы при сборе и анализе данных (когда остановиться, кого исключить, какой тест взять), которые незаметно подгоняют результат.
- эффект ожиданий экспериментатораexperimenter expectancy effect
- Искажение результатов опыта из-за того, что исследователь знает, чего ждать.
- демонстрацияdemonstration
- Показ явления без сравнения условий. Может убедить, но не может доказать причину.
Практикум · Разбор новости о психологическом открытии
Новости вида «психологи доказали» выходят каждую неделю, а повторы к ним приходят через годы. Задание в том, чтобы пропустить одну такую новость через четыре вопроса курса и поставить её главному утверждению честный статус. Нужны сама новость и, если найдётся, статья, на которую она ссылается.
- Найдите новость или пост о новом психологическом эффекте. Выпишите фразу-вывод из заголовка и найдите ссылку на исходную статью или хотя бы её название.
- Восстановите паспорт опыта: на ком мерили, сколько было людей, с чем сравнивали, что считали исходом. Отметьте, чего в новости нет, и совпадает ли исход с тем, о чём говорит заголовок.
- Найдите размер эффекта: d, r, разность долей или числа в людях. Если в новости есть только слово «значимо», отметьте это отдельно и сравните величину эффекта с размером выборки.
- Выясните судьбу работы: была ли предрегистрация, повторяли ли опыт другие лаборатории, на скольких людях и с каким итогом. Отсутствие повтора запишите как отсутствие, а не как подтверждение.
- Поставьте утверждению заголовка статус из шести статусов курса или запишите, что статуса пока нет. Сравните заголовок с выводом самих авторов и отметьте, какая из пяти причин провала, разобранных в уроке, ему грозит.
Вопросы для самопроверки
Новость: «Мультфильмы с драками делают детей агрессивными». В опыте 60 дошкольников смотрели ролик с дракой или спокойный ролик, а потом 20 минут играли в комнате с надувной грушей. После драки дети в среднем чаще били грушу. Что прежде всего не так с заголовком?
- Опыт на дошкольниках о людях вообще ничего не говорит, и его результат не стоит учитывать
- Исходом были удары по игрушке для ударов, а заголовок говорит об агрессии к людям
- Заголовок верен, если разница прошла порог значимости и авторы учли возраст детей
- Двадцать минут игры слишком мало, при долгом наблюдении разница бы выросла
Статья: 24 студента слушали медленную или быструю музыку и решали задачи. Слушавшие медленную решили на 40 % больше, p = 0,04. Повторов пока нет. Какой статус честно поставить утверждению «медленная музыка улучшает решение задач»?
- Выдержало: разница прошла порог значимости, а значит, эффект настоящий и повторится
- Отвергнуто: 24 человека слишком мало, поэтому эффекта нет
- Не было доказательством: опыты на студентах в принципе не говорят о людях
- Пока никакой: это один малый опыт без повтора
В 20 лабораториях по плану, одобренному до сбора данных, 3 000 человек повторили опыт, который в оригинале на 40 людях дал d = 0,70. Вышло d = 0,02, интервал от −0,05 до 0,08. Автор оригинала отвечает, что процедура немного отличалась. Какой вывод следует?
- Эффект в исходной силе при этой процедуре не подтвердился, а довод об отличиях надо проверять новым опытом
- Раз автор оригинала не согласен, спор открыт, и обе стороны стоят на равных данных
- Проверка ничего не значит, потому что от другой процедуры нельзя ждать того же
- Автор оригинала, по всей видимости, подделал данные, иначе такой разрыв не объяснить
В летнем лагере две команды подростков три недели соревновались за призы. Вожатые знали гипотезу, сами вели счёт и решали, когда командам встречаться. Вражда между командами росла. Что может показать такой опыт?
- Что вражда между группами возникает сама, стоит только разделить людей на команды
- Что соревнование за призы рождает вражду, по крайней мере у подростков в лагере
- Вклад деления, турнира и действий вожатых он не разделяет, так что причину вражды не показывает
- Что вражду создали сами подростки, раз вожатые только вели счёт
Заголовок: «В знаменитом опыте 9 человек из 10 отказались помочь незнакомцу». В статье было шесть условий, 9 из 10 отказались в одном из них, а из всех 120 участников отказались 54. Как честно пересказать результат?
- Девять из десяти, ведь именно это условие авторы считали главным и описали подробнее остальных
- В одном условии отказались 9 из 10, по всем 54 из 120, и доля сильно зависела от условий
- Никак: условия разные, поэтому опыт ничего не говорит о помощи
- Около половины людей по природе равнодушны к незнакомцам, это и показал опыт
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Open Science Collaboration, 2015. Estimating the reproducibility of psychological science. Science, 349(6251), aac4716. Копия: https://ppw.kuleuven.be/okp/_pdf/Nosek2015ETROP.pdf: Таблица 1 с разбивкой по подполям: 14 из 55 в социальной психологии против 21 из 42 в когнитивной. Отсюда видно, почему общий итог курса нельзя свести к одному числу.
- Klein et al., 2018. Many Labs 2. Advances in Methods and Practices in Psychological Science, 1(4), 443-490. Открытый доступ: https://journals.sagepub.com/doi/10.1177/2515245918810225: Аннотация и раздел о неоднородности между выборками: насколько эффекты менялись от страны и от WEIRD или менее WEIRD культуры.
- Wagenmakers, E.-J. et al. (2016). Registered Replication Report: Strack, Martin, & Stepper (1988). Perspectives on Psychological Science, 11(6), 917-928. https://pure.uva.nl/ws/files/14872420/Registered_Replication_Report.pdf: Рисунок 4 с результатами 17 лабораторий: как выглядит нулевой результат с узким интервалом рядом с эффектом оригинала.
- Le Texier, 2019. Debunking the Stanford Prison Experiment. American Psychologist, 74(7), 823-839. Открытый препринт: https://osf.io/mjhnp: Разделы о Toyon Hall, об инструктаже охранников 14 августа и о Корпи. Там же цитаты из ответа Зимбардо 2018 года.
- Manning, Levine, Collins, 2007. The Kitty Genovese murder and the social psychology of helping: The parable of the 38 witnesses. American Psychologist, 62(6), 555-562. https://doi.org/10.1037/0003-066X.62.6.555: Раздел «Challenging the story of the 38 witnesses» с показаниями жильцов на суде. На сайте журнала доступ платный, рукопись статьи есть в открытом архиве CiteSeerX.