К содержанию
Фонтум Психология Урок 2 / 24 Все уроки

Главная · Курсы · Психология · Программа курса · Модуль I. Основания · урок 2 из 24

Методы исследования в психологии

От наблюдения к эксперименту: что даёт причинность, а что только связь

Причинный вывод даёт только один дизайн исследования, эксперимент. А обеспечивает этот вывод случайное распределение участников по условиям: различия групп становятся случайной помехой, а не систематическим сдвигом. Случайная выборка нужна не для причинности, а для обобщаемости, и почти ни в одном исследовании не выполнены обе процедуры. Наблюдение и корреляционный дизайн отвечают на другие вопросы: что происходит и что с чем связано.

MIT 9.00SC, Science & Research · Berkeley PSYCH 101 · 45 мин · обновлено 01.10.2026

После урока вы сможете

  • Определять по описанию исследования его дизайн и то, какой вывод он допускает
  • Различать случайное распределение по условиям и случайную выборку и знать, какую гарантию даёт каждое
  • Находить в описании исследования конфаунды, отсутствие ослепления и подмену корреляции причинностью
  • Отделять надёжность измерения от его валидности и оценивать произвольность операционализации
  • Объяснять, что даёт и чего не даёт этическая экспертиза, и почему age-period-cohort confound делает «поколения» неизмеримыми

У психологии есть три базовых способа получить данные, и они отвечают на разные вопросы. Наблюдение (observation) описывает: что происходит, с какой частотой, в каких условиях. Корреляционное исследование (correlational study) устанавливает связь: если одна величина выше, то выше или ниже другая. Эксперимент (experiment) отвечает на причинный вопрос: что изменится, если вмешаться.

Иерархии «наблюдение хуже эксперимента» здесь нет, а есть разделение труда. Разбор 219 записей уличных камер в Великобритании, Нидерландах и ЮАР показал, что хотя бы один свидетель вмешивается в 9 из 10 публичных конфликтов, а с ростом числа присутствующих вероятность вмешательства растёт. Никакой эксперимент этой картины не дал бы: нельзя случайно распределить людей по уличным конфликтам. И наоборот, наблюдение не скажет, почему так происходит.

Ошибка, которую этот урок должен убрать навсегда, состоит в чтении корреляционных данных как причинных. Она почти никогда не выглядит как логическая ошибка. Обычно это одно слово в заголовке: «связано с» превращается в «приводит к», «предсказывает» в «формирует», «дети, которые умели ждать» в «если ребёнка научить ждать». Дальше по тексту нередко стоит корректная формулировка авторов, но читать её уже никто не будет.

Что именно делает эксперимент причинным

В эксперименте исследователь сам задаёт независимую переменную (independent variable), то есть меняет её, и измеряет зависимую (dependent variable), которая должна измениться. Причинность обеспечивает не наличие двух групп и не измерение до и после, а случайное распределение участников по условиям (random assignment). Рандомизация не делает группы одинаковыми. Она делает их различия случайными, то есть помехой известной величины, а не систематическим сдвигом, действующим в одну сторону.

Дальше идёт различение, которое студенты путают систематически. Случайное распределение по условиям даёт причинный вывод. Случайная выборка из популяции (random sampling) даёт обобщаемость. Это разные процедуры с разными гарантиями, и почти ни в одном исследовании не выполнены обе. Идеально рандомизированный эксперимент на 200 студентах-психологах даёт крепкий причинный вывод о студентах-психологах и почти ничего не говорит о человечестве. Репрезентативный опрос 20 000 человек даёт обобщаемое описание и ни одного причинного вывода.

Отсюда практическое правило чтения. Спрашивайте не «был ли эксперимент», а «что именно и кем распределялось случайно». Если случайным был только порядок предъявления заданий, вывод касается порядка. Если не распределялось ничего, перед вами корреляционное исследование, как бы его ни называли авторы и как бы много условий в нём ни сравнивалось.

методДве рандомизации, две гарантии

Random assignment → внутренняя валидность, то есть право говорить о причине. Random sampling → внешняя валидность, то есть право обобщать. Одно не заменяет другого. Вопрос «что здесь было случайным» отвечает сразу на оба.

Контрольные условия, плацебо, слепые процедуры

Контрольное условие нужно, чтобы было с чем сравнивать. Плацебо (placebo) отделяет действие вмешательства от факта его получения. Слепые процедуры отделяют действие вмешательства от ожиданий: в двойном слепом методе (double-blind) ни участник, ни тот, кто с ним работает и регистрирует исход, не знают условия.

Ослепление экспериментатора не сводится к бюрократии. Возьмите знаменитую находку: люди, собиравшие фразы из слов, связанных со старостью, потом медленнее шли по коридору. Влияние ранее предъявленного материала на последующую обработку называют праймингом (priming), а этот его вариант социальным праймингом. Проверка 2012 года поручила опыт экспериментаторам, не знавшим гипотезы, и мерила время инфракрасными датчиками. Эффекта не стало. Во втором опыте половине экспериментаторов сказали, что участники замедлятся. У них замедление появилось и по секундомеру, и по автоматическим датчикам. Решало ожидание экспериментатора, а не способ замера.

Обратите внимание, что здесь сразу два инструмента контроля: ослепление и замена ручного измерения объективным. По отдельности каждый мог не сработать. Вместе они дали однозначный ответ. Так же читайте и клинические данные. В своде 522 двойных слепых рандомизированных испытаний на 116 477 участниках все 21 антидепрессант превзошли плацебо при остром лечении. Но низкий риск систематической ошибки был лишь у 18 % исследований, 78 % финансировались производителями, а неопубликованные данные удалось получить только по 52 % работ. Двойное ослепление даёт необходимое условие, а не достаточное.

на заметкуDoyen et al., 2012

Эффект «пожилых слов» на скорость походки воспроизводится только тогда, когда экспериментатор ждёт замедления, и тогда его фиксируют даже автоматические датчики. Это единственный результат, который стоит помнить об этом эффекте, и лучший аргумент за слепые процедуры в психологии.

Конфаунды и правило невероятно большого эффекта

Смешивающей переменной (confound) называют то, что меняется вместе с независимой переменной и способно объяснить результат самостоятельно. В корреляционных данных конфаунды не устраняются рандомизацией, а в наблюдательных «естественных экспериментах» они часто спрятаны не в психологии участников, а в организации данных.

Учебный случай. В 2011 году сообщили, что вероятность благоприятного решения об условно-досрочном освобождении падает в течение сессии примерно с 65 % почти до нуля и восстанавливается после перерыва на еду. Объяснение предложили простое: судья устаёт принимать решения. Возражение пришло в том же году. Дела рассматривались не в случайном порядке: представленные адвокатом ставились первыми в блоке, а дела заключённых без представителя позже. Позднейшие симуляции показали, что слабого упорядочения вместе с правилом «судья заканчивает блок до перерыва» достаточно, чтобы получить наблюдаемую картину.

Отсюда правило калибровки, которое стоит носить с собой: невероятно большой эффект в наблюдательных данных подаёт сигнал искать конфаунд, а не сенсацию. Если из эффекта следовало бы, что правосудие целиком зависит от обеда, спросите, что ещё в мире выглядело бы иначе при такой величине. Обычно выясняется, что таких последствий мы не наблюдаем.

осторожноПроверка на правдоподобие до всякой статистики

Прежде чем поверить в эффект, оцените его последствия: если он действительно такой величины, что ещё вокруг нас было бы устроено по-другому? Это дешёвый способ поймать артефакт сбора данных, не имея доступа ни к данным, ни к коду.

Три валидности и обмен между ними

Внутренняя валидность (internal validity) говорит о том, насколько вывод о причине защищён от альтернативных объяснений внутри самого исследования. Внешняя (external validity) отвечает за то, насколько он переносится на других людей, другие ситуации и другое время. Конструктная (construct validity) показывает, насколько измеряемое действительно есть то, о чём вы говорите.

Первые две почти всегда находятся в обмене, и пример уже был в начале урока. В лаборатории эффект свидетеля изучают так: человека сажают одного, с одним соседом или с четырьмя, за стеной разыгрывают недомогание и мерят, скоро ли он пойдёт помогать. Распределение по условиям случайное, посторонние объяснения отсечены, внутренняя валидность высокая. На записях 219 уличных конфликтов картина обратная: помощь приходит в 9 случаях из 10, и с числом присутствующих её вероятность растёт. Противоречия тут нет. В лаборатории ситуация неоднозначна, никому не угрожает опасность и свидетели не видят друг друга. На улице нарушены все три условия. Эффект существует ровно в тех условиях, в которых его получили, и это не оговорка, а его содержание.

Урок читателя: вопрос «эффект есть или нет» почти всегда поставлен плохо. Правильных вопросов три. Существует ли эффект, какой он величины и переносится ли он в те условия, о которых вы делаете вывод. Практически все содержательные споры в психологии идут о втором и третьем, а не о первом.

Операционализация, надёжность и валидность измерения

Операционализация (operationalisation) превращает понятие в процедуру измерения. Она всегда произвольна в том смысле, что одному понятию соответствует много возможных процедур, и от выбора зависит результат. Самый известный случай дала «отсрочка удовольствия», превращённая в число минут, которые четырёхлетний ребёнок готов ждать вторую сладость. Когда к этому числу добавили сведения о семье, оказалось, что связь с достижениями подростка держится на них в значительной части. Разбор случая целиком дан в уроке 16.

То есть процедура измеряла не только «силу воли», но и ресурсы семьи. Это и есть вопрос конструктной валидности: что реально попало в число минут. Заметьте, что здесь ничего не подделано и ни одна цифра не оспаривается. Оспаривается только имя, которое дали измеренному.

Надёжность (reliability) и валидность различаются как свойства, и надёжность первична: нельзя измерять правильно тем, что при повторе даёт другой результат. Проверка простая. Дайте тот же инструмент тому же человеку через месяц и посмотрите, насколько совпал результат. Типологические опросники этой проверки обычно не выдерживают: заметная доля людей получает через несколько недель другой тип. Отсюда важное различение. Инструмент может быть осмыслен для сравнения групп и одновременно непригоден для суждения об отдельном человеке. Это два разных вопроса, и задавать их надо порознь.

Кого мы спрашиваем и когда: выборки, самоотчёт, время

Выборки в ведущих психологических журналах происходят подавляющей частью из западных, образованных, промышленно развитых, богатых и демократических обществ. Сокращённо их называют WEIRD, и значительная доля внутри этой доли приходится на студентов-психологов. Беда в том, что именно эти популяции по ряду измеряемых характеристик оказываются статистическими выбросами: зрительные иллюзии, кооперация в экономических играх, представления о себе. Это проблема обобщаемости описаний: «человек вообще» описан по узкому срезу.

Немедленная оговорка, без которой верный вывод превращается в новый миф. Многолабораторный проект Many Labs 2 проверил 28 эффектов на 125 выборках, 15 305 участниках из 36 стран. Оказалось, что разброс размера эффекта объясняется самим эффектом, а не страной или способом сбора данных. Значимая неоднородность нашлась лишь в 11 случаях из 28. То есть утверждение «выборки нерепрезентативны» верно, а вывод «поэтому эффект не переносится» следует не автоматически. Обе оговорки обязательны.

Самоотчёт служит законным источником данных о том, что человек думает и чувствует, и плохим источником данных о причинах его поведения. Люди устойчиво сообщают о предпочитаемом способе подачи материала, и это настоящий факт об их предпочтениях. Но из него не следует, что подстройка метода под предпочтение улучшит результат: это отдельная гипотеза, требующая отдельной проверки, и проверку она не прошла. Разбор дан в уроке 11. Держите различение при себе: описание предпочтения и предсказание пользы от него это разные утверждения.

Кросс-секционный дизайн сравнивает разных людей в один момент времени, а лонгитюдный тех же людей на протяжении времени. Оба упираются в одну принципиальную трудность: возраст, историческую эпоху и год рождения в стандартных данных развести нельзя. Именно поэтому «миллениалы менее лояльны работодателю» эмпирически неотличимо от «молодые люди менее лояльны» и от «в 2010-е рынок труда был другим». Мета-анализы и находят различия около нуля. Подробнее в уроке 17. Здесь дело не в слабых эффектах, а в том, что дизайн в принципе не может выделить нужный.

Этика: откуда взялась процедура

Требования к исследованиям на людях появились как реакция на конкретные случаи, а не из общей гуманности. Нюрнбергский кодекс (1947) сформулировал, что добровольное согласие испытуемого абсолютно необходимо. Исследование сифилиса в Таскиги велось с 1932 по 1972 год и продолжалось после появления пенициллина. Оно стало в США поводом для Национального исследовательского акта 1974 года. Этот акт сделал обязательными этические комитеты, IRB (institutional review board). Белмонтский доклад (1979) закрепил, что информированное согласие состоит из трёх частей: информация, понимание, добровольность.

В психологии свою роль сыграли работы Милгрэма. По архивным материалам экспериментатор регулярно выходил далеко за рамки предписанных четырёх реплик и фактически принуждал участников продолжать. А дебрифинг многим провели с большой задержкой или не провели вовсе. Как это выглядит сегодня, показывает этичная частичная репликация Burger (2009). Остановка на 150 В, многоступенчатый отбор участников, троекратное напоминание о праве выйти, пробный шок 15 В вместо 45 В, немедленный дебрифинг. И при этом воспроизводимый результат.

Тон здесь важен методически. Милгрэм и Зимбардо нарушали нормы, которых в 1961-1971 годах частично не существовало, и ретроспективное морализирование мешает учиться: студент запоминает скандал вместо методологии. Критиковать надо метод и выводы. Практическое следствие для вас как читателя: информированное согласие и одобрение комитета составляют условие допустимости исследования, а не признак его качества. Корректность вывода они не гарантируют вообще никак.

на заметкуСогласие не заменяет дизайн

Одобрение комитета и подписанное согласие говорят о допустимости процедуры, а не о качестве вывода. Розенхан не обеспечил подготовку и защиту своих псевдопациентов и одновременно нарушил собственный протокол, но опубликованный вывод рухнул не из-за этики, а из-за данных. Разбор в уроке 23.

Ключевые исследования

Henrich, Heine & Norenzayan2010Выборки психологии происходят преимущественно из WEIRD-обществ, которые по ряду измерений сами являются выбросами. Проблема обобщаемости описаний.
Doyen, Klein, Pichon & Cleeremans2012Эффект прайминга старости на походку появлялся только там, где экспериментатор ждал замедления, и тогда его фиксировали даже автоматические датчики.
Danziger, Levav & Avnaim-Pesso2011«Голодные судьи»: заявленный переход примерно с 65 % благоприятных решений почти к нулю в течение сессии. Объясняется неслучайным порядком дел, а не усталостью.
Watts, Duncan & Quan2018Тест с маршмеллоу на большой и более представительной выборке: связь числа минут ожидания с достижениями подростка заметно слабеет после учёта сведений о семье и ранних способностей ребёнка.
Philpot, Liebst, Levine, Bernasco & Lindegaard2020219 записей уличных камер в трёх странах: помощь приходит в 9 из 10 конфликтов, и с числом присутствующих её вероятность растёт.
Burger2009Этичная частичная репликация Милгрэма с остановкой на 150 В: подчинение примерно на том же уровне, что 45 лет назад.
Cipriani et al.2018Свод 522 двойных слепых рандомизированных испытаний на 116 477 участниках: все 21 антидепрессант превзошли плацебо при остром лечении, но низкий риск систематической ошибки был лишь у 18 % исследований.
Klein et al. (Many Labs 2)201828 эффектов на 125 выборках, 15 305 участниках из 36 стран: разброс размера эффекта определяется самим эффектом, а не страной. Значимая неоднородность в 11 случаях из 28.

Что подтвердилось, а что нет

сильно ослабленоЭффект наблюдателя: чем больше свидетелей, тем меньше вероятность, что человеку помогут. Иллюстрацией служат 38 свидетелей убийства Китти Дженовезе.

Лабораторная диффузия ответственности реальна в узких условиях: ситуация неоднозначна, опасности нет, свидетели не видят друг друга. Мета-анализ показывает ослабление или исчезновение эффекта при опасности и при наличии тех, кто способен помочь. По 219 записям реальных публичных конфликтов в трёх странах хотя бы один свидетель вмешивался в 9 из 10 случаев, и большее число присутствующих вероятность помощи повышало. История о 38 безучастных свидетелях в существенной части журналистский артефакт: столько людей нападение не наблюдали, а часть свидетелей действовала, включая звонок в полицию. Формулировать надо не «в толпе не помогут», а «важны заметность ситуации, распределение ответственности и способность помочь». Один и тот же феномен, два метода, и противоположные обобщения.

сильно ослаблено«Голодные судьи»: усталость от решений радикально меняет судебные решения в течение рабочего дня.

Заявленная величина, примерно от 65 % благоприятных решений почти до нуля, неправдоподобна для психологического механизма. Дела рассматривались не в случайном порядке: представленные адвокатом ставились первыми в блоке, а симуляции показывают, что этого достаточно для наблюдаемой картины. Учебная ценность кейса не в усталости, а в правиле: невероятно большой эффект в наблюдательных данных подаёт сигнал искать конфаунд.

выдержалоПсихологию изучают на западных студентах-добровольцах, поэтому её эффекты остаются местным явлением и на других странах не воспроизводятся.

Проверено многолабораторным проектом Many Labs 2: 28 находок, 125 выборок, 15 305 участников из 36 стран, единый протокол. Значимая неоднородность между выборками нашлась лишь в 11 случаях из 28, а разброс размера эффекта предсказывался тем, какой эффект проверяют, а не тем, где и на ком его проверяли. Устояла именно переносимость эффектов. Не устояло бы обратное прочтение: из этого не следует, что выборки представительны. Средние по шкалам, распространённости и доли людей с той или иной чертой на узком срезе WEIRD по-прежнему смещены, и «эффект переносится» не значит «этими людьми описано человечество».

Термины

независимая переменнаяindependent variable
То, что исследователь задаёт или меняет сам. В корреляционном исследовании независимой переменной в этом смысле нет.
зависимая переменнаяdependent variable
Измеряемый исход, изменение которого проверяется. Её выбор составляет часть операционализации, а не техническую деталь.
случайное распределениеrandom assignment
Распределение участников по условиям случайным образом. Обеспечивает право на причинный вывод.
случайная выборкаrandom sampling
Случайный отбор участников из популяции. Обеспечивает обобщаемость, но не причинность.
смешивающая переменнаяconfound
Переменная, меняющаяся вместе с независимой и способная объяснить результат вместо неё.
внутренняя валидностьinternal validity
Степень защищённости вывода о причине от альтернативных объяснений внутри самого исследования.
внешняя валидностьexternal validity
Степень переносимости вывода на других людей, другие условия и другое время.
операционализацияoperationalisation
Перевод понятия в конкретную процедуру измерения. Всегда допускает несколько вариантов, и от выбора зависит результат.
двойной слепой методdouble-blind
Процедура, при которой ни участник, ни регистрирующий исход не знают условия. Защищает от ожиданий обеих сторон.
WEIRD-выборкаWEIRD sample
Выборка из западного, образованного, промышленно развитого, богатого и демократического общества. Типична для литературы и нетипична для человечества.

Практикум · Разбор новости о психологическом исследовании

Подмена корреляции причинностью почти всегда происходит на одном слове, и увидеть её можно, только сравнив заголовок с описанием метода. Возьмите реальную новость и проделайте это сравнение целиком: 25-40 минут.

  1. Найдите в новостях за последний месяц заметку о психологическом или медико-психологическом исследовании, в заголовке которой стоит причинное слово: «приводит к», «улучшает», «вызывает», «защищает от», «делает».
  2. Выпишите заголовок дословно и рядом то предложение из текста, которое ближе всего к описанию метода.
  3. Ответьте строго по тексту на четыре вопроса: сколько участников, кто и по какому принципу попал в сравниваемые группы, что именно измеряли как исход, сравнивали людей между собой или измеряли изменение у одних и тех же людей. Затем назовите дизайн: наблюдение, корреляция или эксперимент. Если распределения участников по условиям не было, отметьте это отдельной строкой.
  4. Придумайте два конкурирующих объяснения найденной связи: обратное направление (исход влияет на предиктор) и минимум один конфаунд, правдоподобно связанный с обеими переменными.
  5. Найдите первоисточник, хотя бы аннотацию статьи, и сравните формулировку вывода в ней с формулировкой в заголовке. Выпишите, на каком именно слове произошла подмена и кто её совершил: авторы, пресс-служба или редакция. Затем перепишите заголовок так, чтобы он оставался верным при том дизайне, который в исследовании действительно был: одна фраза, без оговорок в скобках.

Вопросы для самопроверки

Вопрос 1

Исследователь набрал 1 200 человек, репрезентативных для страны по полу, возрасту и региону, и опросил их об уровне стресса и частоте занятий спортом. Что он получил?

  • Причинный вывод о влиянии спорта на стресс, обобщаемый на всю страну благодаря репрезентативной выборке
  • Обобщаемое описание связи между спортом и стрессом, но не причинный вывод
  • Причинный вывод, справедливый только для этой выборки и не переносимый на страну
  • Ни описания, ни вывода: корреляционные данные без эксперимента ничего не доказывают
Вопрос 2

В исследовании эффект обнаруживался, когда экспериментатор знал гипотезу и измерял результат вручную, и исчезал при автоматическом измерении. Что это показывает в первую очередь?

  • Эффект реальный, но слабый: нужна выборка побольше, чтобы он проявился и при автоматической регистрации
  • Эффект зависит от культуры участников, а автоматика этой зависимости не улавливает
  • Измерялись ожидания экспериментатора, а не заявленная переменная
  • Автоматическое измерение менее чувствительно, чем ручное, и потому теряет слабые эффекты
Вопрос 3

Наблюдательное исследование сообщает об эффекте гигантской величины: доля благоприятных решений падает с 65 % почти до нуля в течение нескольких часов. Какая реакция методологически правильная?

  • Принять результат: чем крупнее эффект, тем меньше вероятность, что за ним стоит посторонняя переменная
  • Отвергнуть результат: психологические эффекты такого размера не бывают, значит данные испорчены
  • Потребовать репликации на выборке из другой страны: если эффект повторится, конфаунд исключён
  • Проверить, как формировался порядок наблюдений, и искать конфаунд
Вопрос 4

Угроза стереотипа даёт d = −0.36 в лабораторных исследованиях и около нуля в реальных вступительных тестированиях. Как это корректно описать?

  • Эффект существует, но его перенос на экзаменационные условия не подтверждён
  • Лабораторные исследования были ошибочными: в поле эффект не нашли, значит его не было и в лаборатории
  • Реальные тестирования проведены с нарушением внутренней валидности, поэтому нулевой результат в них ожидаем
  • Никакого эффекта нет: величина d = −0.36 слишком мала, чтобы считать её эффектом
Вопрос 5

Опрос 2024 года показал: сотрудники моложе 30 реже планируют остаться в компании более трёх лет, чем сотрудники старше 50. Что из этого следует?

  • Это поколение менее лояльно: выросшее в других условиях, оно иначе относится к обязательствам перед работодателем
  • Различить эффекты возраста, эпохи и когорты по этим данным нельзя
  • Лояльность снижается с каждым новым поколением, и опрос фиксирует очередной шаг этого спада
  • Данные говорят о возрасте, но не о поколении: возрастной эффект здесь выделен чисто

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Stangor, Introduction to Psychology, гл. 2 «Psychological Science»: Назначенное чтение к сессии MIT «Science & Research». Систематически проходит дизайны, валидности и этику исследования.
  • Kosslyn & Rosenberg, Introducing Psychology, гл. 1 (вторая часть, Research Methods): Равноценная альтернатива: в MIT 9.00SC эти два учебника взаимозаменяемы, и к главе прилагается конспект-опора.
  • Sacks, The Man Who Mistook His Wife For A Hat, гл. 19 «Murder», с. 161-165: MIT назначает этот случай именно к уроку о методе: описание одного пациента как источник гипотез и как предел того, что можно доказать на n = 1.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Психология»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?