Методы исследования в психологии
От наблюдения к эксперименту: что даёт причинность, а что только связь
Причинный вывод даёт только один дизайн исследования, эксперимент. А обеспечивает этот вывод случайное распределение участников по условиям: различия групп становятся случайной помехой, а не систематическим сдвигом. Случайная выборка нужна не для причинности, а для обобщаемости, и почти ни в одном исследовании не выполнены обе процедуры. Наблюдение и корреляционный дизайн отвечают на другие вопросы: что происходит и что с чем связано.
MIT 9.00SC, Science & Research · Berkeley PSYCH 101 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Определять по описанию исследования его дизайн и то, какой вывод он допускает
- Различать случайное распределение по условиям и случайную выборку и знать, какую гарантию даёт каждое
- Находить в описании исследования конфаунды, отсутствие ослепления и подмену корреляции причинностью
- Отделять надёжность измерения от его валидности и оценивать произвольность операционализации
- Объяснять, что даёт и чего не даёт этическая экспертиза, и почему age-period-cohort confound делает «поколения» неизмеримыми
У психологии есть три базовых способа получить данные, и они отвечают на разные вопросы. Наблюдение (observation) описывает: что происходит, с какой частотой, в каких условиях. Корреляционное исследование (correlational study) устанавливает связь: если одна величина выше, то выше или ниже другая. Эксперимент (experiment) отвечает на причинный вопрос: что изменится, если вмешаться.
Иерархии «наблюдение хуже эксперимента» здесь нет, а есть разделение труда. Разбор 219 записей уличных камер в Великобритании, Нидерландах и ЮАР показал, что хотя бы один свидетель вмешивается в 9 из 10 публичных конфликтов, а с ростом числа присутствующих вероятность вмешательства растёт. Никакой эксперимент этой картины не дал бы: нельзя случайно распределить людей по уличным конфликтам. И наоборот, наблюдение не скажет, почему так происходит.
Ошибка, которую этот урок должен убрать навсегда, состоит в чтении корреляционных данных как причинных. Она почти никогда не выглядит как логическая ошибка. Обычно это одно слово в заголовке: «связано с» превращается в «приводит к», «предсказывает» в «формирует», «дети, которые умели ждать» в «если ребёнка научить ждать». Дальше по тексту нередко стоит корректная формулировка авторов, но читать её уже никто не будет.
Что именно делает эксперимент причинным
В эксперименте исследователь сам задаёт независимую переменную (independent variable), то есть меняет её, и измеряет зависимую (dependent variable), которая должна измениться. Причинность обеспечивает не наличие двух групп и не измерение до и после, а случайное распределение участников по условиям (random assignment). Рандомизация не делает группы одинаковыми. Она делает их различия случайными, то есть помехой известной величины, а не систематическим сдвигом, действующим в одну сторону.
Дальше идёт различение, которое студенты путают систематически. Случайное распределение по условиям даёт причинный вывод. Случайная выборка из популяции (random sampling) даёт обобщаемость. Это разные процедуры с разными гарантиями, и почти ни в одном исследовании не выполнены обе. Идеально рандомизированный эксперимент на 200 студентах-психологах даёт крепкий причинный вывод о студентах-психологах и почти ничего не говорит о человечестве. Репрезентативный опрос 20 000 человек даёт обобщаемое описание и ни одного причинного вывода.
Отсюда практическое правило чтения. Спрашивайте не «был ли эксперимент», а «что именно и кем распределялось случайно». Если случайным был только порядок предъявления заданий, вывод касается порядка. Если не распределялось ничего, перед вами корреляционное исследование, как бы его ни называли авторы и как бы много условий в нём ни сравнивалось.
Random assignment → внутренняя валидность, то есть право говорить о причине. Random sampling → внешняя валидность, то есть право обобщать. Одно не заменяет другого. Вопрос «что здесь было случайным» отвечает сразу на оба.
Контрольные условия, плацебо, слепые процедуры
Контрольное условие нужно, чтобы было с чем сравнивать. Плацебо (placebo) отделяет действие вмешательства от факта его получения. Слепые процедуры отделяют действие вмешательства от ожиданий: в двойном слепом методе (double-blind) ни участник, ни тот, кто с ним работает и регистрирует исход, не знают условия.
Ослепление экспериментатора не сводится к бюрократии. Возьмите знаменитую находку: люди, собиравшие фразы из слов, связанных со старостью, потом медленнее шли по коридору. Влияние ранее предъявленного материала на последующую обработку называют праймингом (priming), а этот его вариант социальным праймингом. Проверка 2012 года поручила опыт экспериментаторам, не знавшим гипотезы, и мерила время инфракрасными датчиками. Эффекта не стало. Во втором опыте половине экспериментаторов сказали, что участники замедлятся. У них замедление появилось и по секундомеру, и по автоматическим датчикам. Решало ожидание экспериментатора, а не способ замера.
Обратите внимание, что здесь сразу два инструмента контроля: ослепление и замена ручного измерения объективным. По отдельности каждый мог не сработать. Вместе они дали однозначный ответ. Так же читайте и клинические данные. В своде 522 двойных слепых рандомизированных испытаний на 116 477 участниках все 21 антидепрессант превзошли плацебо при остром лечении. Но низкий риск систематической ошибки был лишь у 18 % исследований, 78 % финансировались производителями, а неопубликованные данные удалось получить только по 52 % работ. Двойное ослепление даёт необходимое условие, а не достаточное.
Эффект «пожилых слов» на скорость походки воспроизводится только тогда, когда экспериментатор ждёт замедления, и тогда его фиксируют даже автоматические датчики. Это единственный результат, который стоит помнить об этом эффекте, и лучший аргумент за слепые процедуры в психологии.
Конфаунды и правило невероятно большого эффекта
Смешивающей переменной (confound) называют то, что меняется вместе с независимой переменной и способно объяснить результат самостоятельно. В корреляционных данных конфаунды не устраняются рандомизацией, а в наблюдательных «естественных экспериментах» они часто спрятаны не в психологии участников, а в организации данных.
Учебный случай. В 2011 году сообщили, что вероятность благоприятного решения об условно-досрочном освобождении падает в течение сессии примерно с 65 % почти до нуля и восстанавливается после перерыва на еду. Объяснение предложили простое: судья устаёт принимать решения. Возражение пришло в том же году. Дела рассматривались не в случайном порядке: представленные адвокатом ставились первыми в блоке, а дела заключённых без представителя позже. Позднейшие симуляции показали, что слабого упорядочения вместе с правилом «судья заканчивает блок до перерыва» достаточно, чтобы получить наблюдаемую картину.
Отсюда правило калибровки, которое стоит носить с собой: невероятно большой эффект в наблюдательных данных подаёт сигнал искать конфаунд, а не сенсацию. Если из эффекта следовало бы, что правосудие целиком зависит от обеда, спросите, что ещё в мире выглядело бы иначе при такой величине. Обычно выясняется, что таких последствий мы не наблюдаем.
Прежде чем поверить в эффект, оцените его последствия: если он действительно такой величины, что ещё вокруг нас было бы устроено по-другому? Это дешёвый способ поймать артефакт сбора данных, не имея доступа ни к данным, ни к коду.
Три валидности и обмен между ними
Внутренняя валидность (internal validity) говорит о том, насколько вывод о причине защищён от альтернативных объяснений внутри самого исследования. Внешняя (external validity) отвечает за то, насколько он переносится на других людей, другие ситуации и другое время. Конструктная (construct validity) показывает, насколько измеряемое действительно есть то, о чём вы говорите.
Первые две почти всегда находятся в обмене, и пример уже был в начале урока. В лаборатории эффект свидетеля изучают так: человека сажают одного, с одним соседом или с четырьмя, за стеной разыгрывают недомогание и мерят, скоро ли он пойдёт помогать. Распределение по условиям случайное, посторонние объяснения отсечены, внутренняя валидность высокая. На записях 219 уличных конфликтов картина обратная: помощь приходит в 9 случаях из 10, и с числом присутствующих её вероятность растёт. Противоречия тут нет. В лаборатории ситуация неоднозначна, никому не угрожает опасность и свидетели не видят друг друга. На улице нарушены все три условия. Эффект существует ровно в тех условиях, в которых его получили, и это не оговорка, а его содержание.
Урок читателя: вопрос «эффект есть или нет» почти всегда поставлен плохо. Правильных вопросов три. Существует ли эффект, какой он величины и переносится ли он в те условия, о которых вы делаете вывод. Практически все содержательные споры в психологии идут о втором и третьем, а не о первом.
Операционализация, надёжность и валидность измерения
Операционализация (operationalisation) превращает понятие в процедуру измерения. Она всегда произвольна в том смысле, что одному понятию соответствует много возможных процедур, и от выбора зависит результат. Самый известный случай дала «отсрочка удовольствия», превращённая в число минут, которые четырёхлетний ребёнок готов ждать вторую сладость. Когда к этому числу добавили сведения о семье, оказалось, что связь с достижениями подростка держится на них в значительной части. Разбор случая целиком дан в уроке 16.
То есть процедура измеряла не только «силу воли», но и ресурсы семьи. Это и есть вопрос конструктной валидности: что реально попало в число минут. Заметьте, что здесь ничего не подделано и ни одна цифра не оспаривается. Оспаривается только имя, которое дали измеренному.
Надёжность (reliability) и валидность различаются как свойства, и надёжность первична: нельзя измерять правильно тем, что при повторе даёт другой результат. Проверка простая. Дайте тот же инструмент тому же человеку через месяц и посмотрите, насколько совпал результат. Типологические опросники этой проверки обычно не выдерживают: заметная доля людей получает через несколько недель другой тип. Отсюда важное различение. Инструмент может быть осмыслен для сравнения групп и одновременно непригоден для суждения об отдельном человеке. Это два разных вопроса, и задавать их надо порознь.
Кого мы спрашиваем и когда: выборки, самоотчёт, время
Выборки в ведущих психологических журналах происходят подавляющей частью из западных, образованных, промышленно развитых, богатых и демократических обществ. Сокращённо их называют WEIRD, и значительная доля внутри этой доли приходится на студентов-психологов. Беда в том, что именно эти популяции по ряду измеряемых характеристик оказываются статистическими выбросами: зрительные иллюзии, кооперация в экономических играх, представления о себе. Это проблема обобщаемости описаний: «человек вообще» описан по узкому срезу.
Немедленная оговорка, без которой верный вывод превращается в новый миф. Многолабораторный проект Many Labs 2 проверил 28 эффектов на 125 выборках, 15 305 участниках из 36 стран. Оказалось, что разброс размера эффекта объясняется самим эффектом, а не страной или способом сбора данных. Значимая неоднородность нашлась лишь в 11 случаях из 28. То есть утверждение «выборки нерепрезентативны» верно, а вывод «поэтому эффект не переносится» следует не автоматически. Обе оговорки обязательны.
Самоотчёт служит законным источником данных о том, что человек думает и чувствует, и плохим источником данных о причинах его поведения. Люди устойчиво сообщают о предпочитаемом способе подачи материала, и это настоящий факт об их предпочтениях. Но из него не следует, что подстройка метода под предпочтение улучшит результат: это отдельная гипотеза, требующая отдельной проверки, и проверку она не прошла. Разбор дан в уроке 11. Держите различение при себе: описание предпочтения и предсказание пользы от него это разные утверждения.
Кросс-секционный дизайн сравнивает разных людей в один момент времени, а лонгитюдный тех же людей на протяжении времени. Оба упираются в одну принципиальную трудность: возраст, историческую эпоху и год рождения в стандартных данных развести нельзя. Именно поэтому «миллениалы менее лояльны работодателю» эмпирически неотличимо от «молодые люди менее лояльны» и от «в 2010-е рынок труда был другим». Мета-анализы и находят различия около нуля. Подробнее в уроке 17. Здесь дело не в слабых эффектах, а в том, что дизайн в принципе не может выделить нужный.
Этика: откуда взялась процедура
Требования к исследованиям на людях появились как реакция на конкретные случаи, а не из общей гуманности. Нюрнбергский кодекс (1947) сформулировал, что добровольное согласие испытуемого абсолютно необходимо. Исследование сифилиса в Таскиги велось с 1932 по 1972 год и продолжалось после появления пенициллина. Оно стало в США поводом для Национального исследовательского акта 1974 года. Этот акт сделал обязательными этические комитеты, IRB (institutional review board). Белмонтский доклад (1979) закрепил, что информированное согласие состоит из трёх частей: информация, понимание, добровольность.
В психологии свою роль сыграли работы Милгрэма. По архивным материалам экспериментатор регулярно выходил далеко за рамки предписанных четырёх реплик и фактически принуждал участников продолжать. А дебрифинг многим провели с большой задержкой или не провели вовсе. Как это выглядит сегодня, показывает этичная частичная репликация Burger (2009). Остановка на 150 В, многоступенчатый отбор участников, троекратное напоминание о праве выйти, пробный шок 15 В вместо 45 В, немедленный дебрифинг. И при этом воспроизводимый результат.
Тон здесь важен методически. Милгрэм и Зимбардо нарушали нормы, которых в 1961-1971 годах частично не существовало, и ретроспективное морализирование мешает учиться: студент запоминает скандал вместо методологии. Критиковать надо метод и выводы. Практическое следствие для вас как читателя: информированное согласие и одобрение комитета составляют условие допустимости исследования, а не признак его качества. Корректность вывода они не гарантируют вообще никак.
Одобрение комитета и подписанное согласие говорят о допустимости процедуры, а не о качестве вывода. Розенхан не обеспечил подготовку и защиту своих псевдопациентов и одновременно нарушил собственный протокол, но опубликованный вывод рухнул не из-за этики, а из-за данных. Разбор в уроке 23.
Ключевые исследования
| Henrich, Heine & Norenzayan | 2010 | Выборки психологии происходят преимущественно из WEIRD-обществ, которые по ряду измерений сами являются выбросами. Проблема обобщаемости описаний. |
| Doyen, Klein, Pichon & Cleeremans | 2012 | Эффект прайминга старости на походку появлялся только там, где экспериментатор ждал замедления, и тогда его фиксировали даже автоматические датчики. |
| Danziger, Levav & Avnaim-Pesso | 2011 | «Голодные судьи»: заявленный переход примерно с 65 % благоприятных решений почти к нулю в течение сессии. Объясняется неслучайным порядком дел, а не усталостью. |
| Watts, Duncan & Quan | 2018 | Тест с маршмеллоу на большой и более представительной выборке: связь числа минут ожидания с достижениями подростка заметно слабеет после учёта сведений о семье и ранних способностей ребёнка. |
| Philpot, Liebst, Levine, Bernasco & Lindegaard | 2020 | 219 записей уличных камер в трёх странах: помощь приходит в 9 из 10 конфликтов, и с числом присутствующих её вероятность растёт. |
| Burger | 2009 | Этичная частичная репликация Милгрэма с остановкой на 150 В: подчинение примерно на том же уровне, что 45 лет назад. |
| Cipriani et al. | 2018 | Свод 522 двойных слепых рандомизированных испытаний на 116 477 участниках: все 21 антидепрессант превзошли плацебо при остром лечении, но низкий риск систематической ошибки был лишь у 18 % исследований. |
| Klein et al. (Many Labs 2) | 2018 | 28 эффектов на 125 выборках, 15 305 участниках из 36 стран: разброс размера эффекта определяется самим эффектом, а не страной. Значимая неоднородность в 11 случаях из 28. |
Что подтвердилось, а что нет
Лабораторная диффузия ответственности реальна в узких условиях: ситуация неоднозначна, опасности нет, свидетели не видят друг друга. Мета-анализ показывает ослабление или исчезновение эффекта при опасности и при наличии тех, кто способен помочь. По 219 записям реальных публичных конфликтов в трёх странах хотя бы один свидетель вмешивался в 9 из 10 случаев, и большее число присутствующих вероятность помощи повышало. История о 38 безучастных свидетелях в существенной части журналистский артефакт: столько людей нападение не наблюдали, а часть свидетелей действовала, включая звонок в полицию. Формулировать надо не «в толпе не помогут», а «важны заметность ситуации, распределение ответственности и способность помочь». Один и тот же феномен, два метода, и противоположные обобщения.
Заявленная величина, примерно от 65 % благоприятных решений почти до нуля, неправдоподобна для психологического механизма. Дела рассматривались не в случайном порядке: представленные адвокатом ставились первыми в блоке, а симуляции показывают, что этого достаточно для наблюдаемой картины. Учебная ценность кейса не в усталости, а в правиле: невероятно большой эффект в наблюдательных данных подаёт сигнал искать конфаунд.
Проверено многолабораторным проектом Many Labs 2: 28 находок, 125 выборок, 15 305 участников из 36 стран, единый протокол. Значимая неоднородность между выборками нашлась лишь в 11 случаях из 28, а разброс размера эффекта предсказывался тем, какой эффект проверяют, а не тем, где и на ком его проверяли. Устояла именно переносимость эффектов. Не устояло бы обратное прочтение: из этого не следует, что выборки представительны. Средние по шкалам, распространённости и доли людей с той или иной чертой на узком срезе WEIRD по-прежнему смещены, и «эффект переносится» не значит «этими людьми описано человечество».
Термины
- независимая переменнаяindependent variable
- То, что исследователь задаёт или меняет сам. В корреляционном исследовании независимой переменной в этом смысле нет.
- зависимая переменнаяdependent variable
- Измеряемый исход, изменение которого проверяется. Её выбор составляет часть операционализации, а не техническую деталь.
- случайное распределениеrandom assignment
- Распределение участников по условиям случайным образом. Обеспечивает право на причинный вывод.
- случайная выборкаrandom sampling
- Случайный отбор участников из популяции. Обеспечивает обобщаемость, но не причинность.
- смешивающая переменнаяconfound
- Переменная, меняющаяся вместе с независимой и способная объяснить результат вместо неё.
- внутренняя валидностьinternal validity
- Степень защищённости вывода о причине от альтернативных объяснений внутри самого исследования.
- внешняя валидностьexternal validity
- Степень переносимости вывода на других людей, другие условия и другое время.
- операционализацияoperationalisation
- Перевод понятия в конкретную процедуру измерения. Всегда допускает несколько вариантов, и от выбора зависит результат.
- двойной слепой методdouble-blind
- Процедура, при которой ни участник, ни регистрирующий исход не знают условия. Защищает от ожиданий обеих сторон.
- WEIRD-выборкаWEIRD sample
- Выборка из западного, образованного, промышленно развитого, богатого и демократического общества. Типична для литературы и нетипична для человечества.
Практикум · Разбор новости о психологическом исследовании
Подмена корреляции причинностью почти всегда происходит на одном слове, и увидеть её можно, только сравнив заголовок с описанием метода. Возьмите реальную новость и проделайте это сравнение целиком: 25-40 минут.
- Найдите в новостях за последний месяц заметку о психологическом или медико-психологическом исследовании, в заголовке которой стоит причинное слово: «приводит к», «улучшает», «вызывает», «защищает от», «делает».
- Выпишите заголовок дословно и рядом то предложение из текста, которое ближе всего к описанию метода.
- Ответьте строго по тексту на четыре вопроса: сколько участников, кто и по какому принципу попал в сравниваемые группы, что именно измеряли как исход, сравнивали людей между собой или измеряли изменение у одних и тех же людей. Затем назовите дизайн: наблюдение, корреляция или эксперимент. Если распределения участников по условиям не было, отметьте это отдельной строкой.
- Придумайте два конкурирующих объяснения найденной связи: обратное направление (исход влияет на предиктор) и минимум один конфаунд, правдоподобно связанный с обеими переменными.
- Найдите первоисточник, хотя бы аннотацию статьи, и сравните формулировку вывода в ней с формулировкой в заголовке. Выпишите, на каком именно слове произошла подмена и кто её совершил: авторы, пресс-служба или редакция. Затем перепишите заголовок так, чтобы он оставался верным при том дизайне, который в исследовании действительно был: одна фраза, без оговорок в скобках.
Вопросы для самопроверки
Исследователь набрал 1 200 человек, репрезентативных для страны по полу, возрасту и региону, и опросил их об уровне стресса и частоте занятий спортом. Что он получил?
- Причинный вывод о влиянии спорта на стресс, обобщаемый на всю страну благодаря репрезентативной выборке
- Обобщаемое описание связи между спортом и стрессом, но не причинный вывод
- Причинный вывод, справедливый только для этой выборки и не переносимый на страну
- Ни описания, ни вывода: корреляционные данные без эксперимента ничего не доказывают
В исследовании эффект обнаруживался, когда экспериментатор знал гипотезу и измерял результат вручную, и исчезал при автоматическом измерении. Что это показывает в первую очередь?
- Эффект реальный, но слабый: нужна выборка побольше, чтобы он проявился и при автоматической регистрации
- Эффект зависит от культуры участников, а автоматика этой зависимости не улавливает
- Измерялись ожидания экспериментатора, а не заявленная переменная
- Автоматическое измерение менее чувствительно, чем ручное, и потому теряет слабые эффекты
Наблюдательное исследование сообщает об эффекте гигантской величины: доля благоприятных решений падает с 65 % почти до нуля в течение нескольких часов. Какая реакция методологически правильная?
- Принять результат: чем крупнее эффект, тем меньше вероятность, что за ним стоит посторонняя переменная
- Отвергнуть результат: психологические эффекты такого размера не бывают, значит данные испорчены
- Потребовать репликации на выборке из другой страны: если эффект повторится, конфаунд исключён
- Проверить, как формировался порядок наблюдений, и искать конфаунд
Угроза стереотипа даёт d = −0.36 в лабораторных исследованиях и около нуля в реальных вступительных тестированиях. Как это корректно описать?
- Эффект существует, но его перенос на экзаменационные условия не подтверждён
- Лабораторные исследования были ошибочными: в поле эффект не нашли, значит его не было и в лаборатории
- Реальные тестирования проведены с нарушением внутренней валидности, поэтому нулевой результат в них ожидаем
- Никакого эффекта нет: величина d = −0.36 слишком мала, чтобы считать её эффектом
Опрос 2024 года показал: сотрудники моложе 30 реже планируют остаться в компании более трёх лет, чем сотрудники старше 50. Что из этого следует?
- Это поколение менее лояльно: выросшее в других условиях, оно иначе относится к обязательствам перед работодателем
- Различить эффекты возраста, эпохи и когорты по этим данным нельзя
- Лояльность снижается с каждым новым поколением, и опрос фиксирует очередной шаг этого спада
- Данные говорят о возрасте, но не о поколении: возрастной эффект здесь выделен чисто
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Stangor, Introduction to Psychology, гл. 2 «Psychological Science»: Назначенное чтение к сессии MIT «Science & Research». Систематически проходит дизайны, валидности и этику исследования.
- Kosslyn & Rosenberg, Introducing Psychology, гл. 1 (вторая часть, Research Methods): Равноценная альтернатива: в MIT 9.00SC эти два учебника взаимозаменяемы, и к главе прилагается конспект-опора.
- Sacks, The Man Who Mistook His Wife For A Hat, гл. 19 «Murder», с. 161-165: MIT назначает этот случай именно к уроку о методе: описание одного пациента как источник гипотез и как предел того, что можно доказать на n = 1.