К содержанию
Фонтум Борьба с бедностью Урок 21 / 24 Все уроки

Главная · Курсы · Борьба с бедностью · Программа курса · Модуль VII. Село, риск и голова · урок 21 из 24

Бедность и IQ: откуда 13 пунктов

Лабораторная величина, пересчитанная в чужую шкалу по договорному правилу, и что от неё осталось после трёх опубликованных ходов в одном журнале

Тринадцать пунктов IQ, которые бедность будто бы отнимает, это пересчёт лабораторной величины в чужую шкалу: интеллект в работе 2013 года не измеряли никому. Посетителей торгового центра в Нью-Джерси ставили перед трудным денежным сценарием, и у менее обеспеченной половины результат по матрицам Равена падал с d Коэна от 0,88 до 0,94. Свод 2024 года из 14 величин эффекта дал 0,09 при интервале от минус 0,03 до 0,21, примерно на порядок меньше лабораторной.

Mani, Mullainathan, Shafir, Zhao 2013, Science · O'Donnell и соавторы 2021, PNAS · Kaur, Mullainathan, Oh, Schilbach 2025 · 29 мин · обновлено 24.09.2026

После урока вы сможете

  • Отличать величину, измеренную прибором, от неё же, пересчитанной в чужую шкалу по договорному правилу
  • Называть головной результат работы 2013 года: взаимодействие дохода и трудности, а не главный эффект
  • Читать спор о работе как список претензий и того, что стало с каждой, а не как счёт «столько-то из двадцати»
  • Ставить рядом лабораторную величину 0,88-0,94 и сводную оценку 0,09 с интервалом от −0,03 до 0,21
  • Различать исход «баллы на задаче» и исход «выработка на работе»

Четыреста шестьдесят четыре фермера, выращивающих сахарный тростник в 54 деревнях двух округов Тамилнада, прошли одни и те же задачи дважды: до уборки и после. Оба опроса уложились в четыре месяца 2010 года. Сахарные заводы разворачивают даты уборки на три-пять месяцев, поэтому один и тот же месяц для одних был «до», а для других «после». Календарь этим и снимался: сравнивали не сезоны, а одного человека в двух положениях его кошелька.

До уборки те же люди решали хуже. По прогрессивным матрицам Равена в среднем 4,35 верного ответа против 5,45 после уборки (P меньше 0,001, n = 460). На числовой задаче Струпа ушло 146 секунд против 131 (P меньше 0,001, n = 452). Что до уборки они действительно беднее, проверено отдельно и напечатано рядом. Закладывали вещи 78 % против 4 %, непогашенные займы имели 99 % против 13 %.

Урок написан не ради строк этой таблицы. В работе есть величина, которой в таблицах нет вовсе: сказано, что наблюдённые эффекты соответствуют примерно тринадцати пунктам IQ. Оговорка стоит в том же предложении: пересчёт сделан «по общепринятому приближению, которым пользуются исследователи интеллекта». Интеллект здесь не измеряли никому.

Урок о том, что стало с этой величиной за тринадцать лет. Её проверяли тем же прибором на выборке в пять раз большей. Её разбирали в трёх опубликованных ходах одного журнала и сводили мета-анализом. И отдельно проверяли там, где исходом был не бланк с задачами, а часовая выработка на сдельной работе.

Что в этой работе есть на самом деле

Работа состоит из двух частей, и устроены они по-разному. Первая лабораторная, поставлена в торговом центре Нью-Джерси. Посетителям за плату предъявляли по четыре денежных сценария: половине трудный, где машину чинить за 1 500 долларов, половине лёгкий, за 150. Между сценариями мерили матрицы Равена и задачу на когнитивный контроль.

«Богатых» и «бедных» делили по медиане эффективного дохода: дохода домохозяйства, поделённого на корень из его размера. Медианный доход выборки авторы называют примерно 70 тысячами долларов, нижнюю границу примерно двадцатью. Объёмы небольшие: 101 человек в первом эксперименте, 100 в третьем, 96 в четвёртом. Это посетители американского торгового центра, а не бедные в смысле остальных уроков курса.

Головной результат лабораторной части это взаимодействие дохода и трудности, а не главный эффект. В первом эксперименте по Равену F(1,97) = 5,12 при P = 0,03. По когнитивному контролю F(1,97) = 7,86 при P меньше 0,01. О величине авторы пишут сами: d Коэна в этом и последующих повторениях лежит между 0,88 и 0,94. В третьем эксперименте платили по 25 центов за верный ответ, и «бедная» половина всё равно заработала на 18 % меньше.

Вторая часть полевая, и в ней бедность не назначали жребием, а ждали сезона. Приборы те же: матрицы Равена и числовая задача Струпа по 75 проб на участника. Ошибок на Струпе до уборки было тоже больше: 5,93 против 5,16 (P меньше 0,001, n = 453).

об исследованииЧто авторы проверили сами

Три очевидных объяснения авторы проверили и отвергли, и все три проверки напечатаны в самой статье. Физическая нагрузка: у 316 фермеров «до уборки» означало «после физической уборки, но до оплаты», и на этой подвыборке результаты, по их словам, весьма схожие. Обучение: 100 случайно отобранных фермеров придержали и опросили впервые уже после уборки. По Равену и времени реакции различий нет, а по числу ошибок на Струпе следы обучения есть, и авторы пишут об этом сами. Питание: в пилоте 2009 года на 188 фермерах других округов расходы на еду до уборки составили 2 663 рупии в месяц против 2 592 после, то есть до уборки ели не меньше. Стресс: там же пульс и давление перед уборкой выше, но при контроле на все три биомаркера коэффициент не изменился. Он равен −1,46 при ошибке 0,52 и n = 222.

Откуда взялись тринадцать пунктов

Абзац, из которого разошлась вся история, стоит под заголовком «How large are these effects?». Там сказано: исследователи сна мерили на тех же матрицах Равена, во что обходится полностью бессонная ночь. В стандартных отклонениях лабораторные находки того же размера, а полевые «три четверти этого размера». И дальше: «по общепринятому приближению, которым пользуются исследователи интеллекта, при среднем 100 и стандартном отклонении 15 наблюдённые нами эффекты соответствуют ~13 пунктам IQ».

Отсюда три поправки, и без них фраза неверна трижды. Первая: тринадцать пунктов означают пересчёт величины в стандартных отклонениях по договорному правилу, а не результат измерения интеллекта. Вторая: пересчитана лабораторная величина с посетителей торгового центра, а полевые оценки сами авторы называют равными трём четвертям от неё. Третья: сравнение с бессонной ночью это сравнение величин эффекта, а не утверждение, что бедность и бессонница делают с человеком одно и то же.

Арифметика самого пересчёта законна. Шкала интеллекта построена соглашением: среднее 100, стандартное отклонение 15. Значит, эффект в одно стандартное отклонение равен пятнадцати пунктам по определению шкалы, а не по измерению.

ловушкаПункты, которых никто не мерил

Проверяется это одним вопросом: каким прибором получены пункты. Прибора нет, есть шкала. Тестов интеллекта фермерам не давали, а матрицы Равена стоят здесь как задача на текущее решение. В лаборатории ту же задачу давали дважды за один сеанс. Величина в стандартных отклонениях переводится в любую шкалу, у которой объявлены среднее и разброс, и обратно тоже. Тринадцать пунктов при разбросе 15 это 0,87 стандартного отклонения, то есть чуть ниже объявленного авторами диапазона 0,88-0,94. Полевая величина в три четверти от него дала бы около десяти пунктов той же шкалы, и в пересказах этого числа нет.

Первое печатное возражение

Первый комментарий вышел в том же журнале 6 декабря 2013 года. Возражение конкретное: при переанализе без разбиения дохода на две половины находки не подтверждаются. Взаимодействия дохода с экспериментальным воздействием комментаторы называют ложными. Порождает их, по их разбору, эффект потолка от коротких и лёгких тестов. Вывод комментария сформулирован прямо: действие финансовой тревоги не ограничено бедными.

Ответ авторов напечатан в тот же день и на той же странице. Отвечают они по трём пунктам. При непрерывной переменной дохода взаимодействие остаётся устойчивым во всех их экспериментах. Результаты по задаче на когнитивный контроль эффектом потолка, по их проверке, не объясняются. Улучшение после уборки устойчиво к обучению. Оба текста у издателя закрыты, и курс берёт их дословные аннотации, не пересказывая большего.

Это спор, который решается пересчётом, и тем он ценен. Спор идёт об одном решении аналитика: делить ли непрерывную переменную по медиане. Каждая сторона называет свою процедуру и печатает, что из неё выходит.

миф«Бедные хуже соображают»

Так читают заголовок работы, а работа этого не утверждает. Головной её результат это взаимодействие: разница появляется тогда, когда человеку предъявлен трудный денежный сценарий, а не сама по себе. В полевой части сравнения бедных с богатыми нет вовсе: там один и тот же фермер сравнивается с собой до уборки и после, и по устройству опыта иначе быть не может. И вывод первого же печатного комментария идёт в ту же сторону: действие финансовых забот не ограничено бедными. Проверяется это по описанию модели, а не по заголовку.

Тот же прибор, больше людей

В 2016 году тот же прибор взяли намеренно, ради прямой сопоставимости. Онлайн-опросы: участников случайно назначали на опрос незадолго до зарплаты или вскоре после неё. На ком мерили: 3 821 участник с годовым доходом домохозяйства ниже 40 тысяч долларов, Соединённые Штаты. В итоговых расчётах первого исследования 1 056 участников, второго исследования 2 496 участников и 119 684 пробы.

Головная таблица считает логарифм времени реакции, ошибки сгруппированы по участнику. Первое исследование дало 0,02 при стандартной ошибке 0,029, второе, на том же числовом Струпе, показало 0,00 при ошибке 0,011. Данные фермеров, пересчитанные теми же авторами, дали 0,19 при ошибке 0,036, и передали их сами авторы работы 2013 года.

Списать расхождение на слабый денежный шок нельзя, и авторы закрывают такое объяснение счётом. До зарплаты участники тратили на 23 % меньше в первом исследовании и на 48 % меньше во втором. У фермеров расходы до уборки были ниже на 10 %. Чтобы свести первую оценку с оценкой на фермерах, шок «до и после уборки» должен быть больше платёжного более чем в одиннадцать раз. А со второй свести нельзя вовсе: знаки разные.

Найдено при этом не «ничего». До зарплаты участники ведут себя так, будто сильнее предпочитают ближнее. Но только в выборе между денежными наградами, а не между заданиями на усилие. Различий в склонности к риску, качестве решений и когнитивных задачах не нашлось. И среда тут другая с обеих сторон: зарплата раз в две недели против годового дохода раз в год.

Один и тот же прибор, три оценкионлайн, до зарплаты: 1 056 участников0,02 (0,029)онлайн, тот же Струп: 2 496 участников0,00 (0,011)фермеры, до уборки: 451 наблюдение0,19 (0,036)0+0,10+0,20точка: оценка, полоса: ± одна ошибка
Коэффициент при логарифме времени реакции и полоса плюс-минус одна стандартная ошибка. Сверху два онлайн-исследования 2016 года на людях с доходом ниже 40 тысяч долларов, снизу данные тамилнадских фермеров, пересчитанные теми же авторами

Аудит двадцати работ

В 2021 году вышел эмпирический аудит литературы о дефиците. Отбор объявлен и воспроизводим. Из 198 статей, цитирующих опорную работу 2012 года, отобрали 32, отвечающие двум условиям, и из них тянули жребий. Условия такие: дефицит выступает экспериментальным фактором, и опыт можно повторить онлайн. Репликаций вышло двадцать, все методы и объёмы предрегистрированы, а объём каждой задан в две с половиной величины оригинала.

Числа такие. Величина эффекта в репликации оказалась меньше оригинальной у 80 % из двадцати работ и противоположной по знаку у 30 %. Из двадцати оригиналов со значимым результатом значимость получили четыре репликации. И строка про мощность: только у девяти оригиналов интервал включал величину, которую эта же работа обнаружила бы с вероятностью хотя бы в треть.

Собственную границу авторы аудита называют сами. Самые крупные эффекты этой литературы получены в труднодоступных сообществах и репликации поддаются плохо. Полевую работу 2013 года они относят к таким случаям. Их вывод сформулирован так: исследования дефицита, поставленные онлайн, надёжно не воспроизводятся. Это утверждение об онлайн-части литературы, а не обо всей.

Через год в том же журнале вышла опубликованная поправка. Одну репликацию убрали и переделали: материалы не совпадали с оригинальными. Две аналитические ошибки, указанные оппонентами, исправили. В одной не включили участников с нулём кликов и не отбросили выбросы по доходу. Оценка сдвинулась с 0,027 на 0,033 при интервалах, включающих ноль. Во второй не удалили два дублирующихся ответа, и от правки сдвинулись только края интервала, в третьем знаке.

Возражение и ответ

Возражение вышло в 2023 году, там же. Претензий четыре, и они перечислены списком. Включены работы не о ресурсном дефиците. Собственный критерий отбора не выполнен. Есть аналитические ошибки. Часть репликаций неверна оригиналу. Затронуто этим, по счёту оппонентов, не меньше десяти работ из двадцати. Про репликацию полевой работы сказано конкретно: одну из двух головных зависимых переменных не измеряли вовсе.

Второе замечание там же: про уровень исполнения задач. Участники репликации на исходном уровне в десять раз чаще работали на уровне случайного угадывания или ниже. Значит, чтобы воспроизвести исходный эффект, в опытном условии результат должен был упасть ниже случайного.

Ответ вышел в том же номере. Разнородность работ признана, но названа следствием широких критериев, а не ошибкой. Отклонение от собственного критерия признано прямо, с благодарностью оппонентам. Аналитические ошибки признаны и исправлены поправкой. Правку на асимметрию распределения авторы аудита отвергли как принятую после того, как результат увидели. А по упрёку в том, что работу о рождественских покупках реплицировали весной, они поставили две новые репликации, и все три оригинал не воспроизвели.

Рядом стоит поставить ещё один документ: он о том же круге работ и написан теми же руками. В 2019 году авторы опорной работы 2012 года сами провели предрегистрированные высокомощные повторения всех её экспериментов. Гипотезу о когнитивной усталости от дефицита они не подтвердили, и результат, пишут они, вышел противоположным исходному. Эксперименты о дорогих займах при дефиците воспроизвелись полностью.

Читать этот обмен счётом побед нельзя. Три хода за два года, считая поправку внутри первого. Обе стороны признали конкретные ошибки и обе от части упрёков отбились. Унести отсюда стоит формат: список претензий и того, что стало с каждой, а не итог «четыре из двадцати». Ни одна работа этой истории не отозвана и ни в какой подделке не уличена. Ошибки нашли внутри поля и исправили в печати.

Что дал свод

Свод вышел в 2024 году и спрашивал именно про взаимодействие: финансовые сигналы на фоне бедности, исход измерен когнитивными показателями. Работы, где участники зарабатывали деньги за результат, исключены намеренно. Собрано 14 величин эффекта из 10 исследований, модель: байесовская многоуровневая мета-регрессия. Это не отдельная работа, а свод работ, и своего объёма участников у него нет.

Сводная оценка вышла такая: 0,09 при интервале от −0,03 до 0,21 и разбросе между работами 0,16 с интервалом от 0,09 до 0,29. Авторы называют это умеренным свидетельством против существования эффекта и тут же пишут, что вывод неустойчив к выбору априорного распределения. Байесовский фактор для гипотезы «эффект лежит внутри полосы практической эквивалентности плюс-минус 0,1» равен 0,21. Свидетельств за или против выборочной публикации свод не нашёл.

Сопоставление, ради которого свод здесь и стоит, читается в одну строку. В лаборатории 2013 года величина от 0,88 до 0,94, в своде 2024 года 0,09 с интервалом, включающим ноль. Это разрыв примерно на порядок, и он и есть содержание спора. Собственная оговорка авторов свода обязательна: доступных свидетельств, по их словам, крайне мало, и сильного вывода сделать нельзя.

Выработка вместо теста

Все предыдущие числа получены на задачах: бланк, экран, секундомер. Работа 2025 года мерила другое: часовую выработку на настоящей сдельной работе. Полевой эксперимент поставлен на собственном производственном участке исследователей: 408 низкодоходных мужчин-рабочих сельской Одиши, изготовление тарелок из листьев, сухой сезон. Жребием разыгрывали момент выплаты уже заработанного.

Фон назван числами: 70 % рабочих говорят, что очень беспокоятся о деньгах, и отвлекаются на эти заботы в половине рабочих дней. Что они делают с ранними деньгами, измерено сразу: в первые три дня доля погасивших хоть какой-то долг выше на 40 процентных пунктов. На следующий день после выплаты выработка выше на 0,109 стандартного отклонения, то есть на 6,9 % (p = 0,020). Прибавка держится и в оставшиеся дни. Доверительного интервала к этой величине первоисточник в добытой части базы не печатает, и вторую половину результата здесь взять неоткуда.

Что это не «просто старались сильнее», проверено отдельным приёмом. Кроме выработки мерили следы исправленных ошибок: стежки и парные отверстия от вынутых. Рабочий об этом измерении не знал. Такие следы после выплаты стали реже на 0,08 стандартного отклонения (p = 0,092), а у беднейших на 0,13 (p = 0,037). Повышение сдельной ставки, для сравнения, поднимает выработку на 0,020 и на внимательность не действует вовсе (p различия 0,001).

Рядом стоит поставить эксперимент, где двигали не деньги, а сон. В Ченнаи 452 взрослых из низкодоходных слоёв спят в среднем 5,5 часа при восьми часах в постели. Сон там мерили актиграфией, а не самоотчётом. Сто девятнадцать экспертов по сну и по экономике предсказали заранее прирост выработки на 7 % от получаса добавочного ночного сна. Трёхнедельное вмешательство подняло сон на 27 минут за ночь, а обнаружимых эффектов на познание, производительность, решения и самочувствие не оказалось. Предложение труда при этом слегка снизилось.

Одно там всё-таки сработало, и это не ночной сон. Короткий дневной сон на рабочем месте поднял сводный индекс исходов на 0,12 стандартного отклонения и одновременно сократил рабочее время. Работа об оплате мерила только мужчин, и это часть её паспорта. В работе о сне пол участников в добытой части базы не назван.

здесь кончается измерениеЗдесь кончается измерение

Мерили две вещи, обе в Индии: результат на матрицах Равена и числовой задаче Струпа у 464 фермеров Тамилнада до и после уборки, и часовую выработку 408 сдельных рабочих Одиши после досрочной выплаты заработанного. Отсюда не следует, когда и как платить людям в другом месте, потому что решение требует того, чего в этих измерениях нет. Цен и сроков другого рынка труда: здесь мерили сдельную работу на участке самих исследователей в сухой сезон. Того, что для самих работников важнее раннего платежа: их об этом не спрашивали. И того, что станет с прибором при смене исхода: бланк с задачами и часовая выработка меряют разные вещи, и переносить величину с одного на другой нельзя. Принимают такое решение сами работники, их наниматели и те, кто отвечает за порядок расчётов, и на этом курс останавливается. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.

Что дальше

Из урока стоит унести три различения. Величина, пересчитанная в чужую шкалу, и величина, измеренная прибором, это разные вещи, и вторая у первой не наследуется. Взаимодействие и главный эффект тоже разные вещи: «разница появляется при трудном денежном сценарии» и «бедные соображают хуже» не одно утверждение. И третье: спор из трёх напечатанных ходов читается списком претензий, а не счётом побед.

Модуль о селе, риске и голове на этом кончается. В нём не раз повторилась одна история: громкая величина, а потом проверка, которая вышла меньше. Следующий модуль спрашивает, бывает ли это правилом, и отвечает числом. Он начинается с программы, которую проверяли сто одиннадцать раз подряд. А доходит до 126 испытаний, на которых измерено, насколько эффект в журнале крупнее эффекта в работе ведомства.

Ключевые работы

Mani A, Mullainathan S, Shafir E, Zhao J, Science2013Две части в одной работе. Лабораторная: посетителям торгового центра в Нью-Джерси предъявляли по четыре денежных сценария, трудный (чинить машину за 1 500 долларов) или лёгкий (за 150), между сценариями мерили матрицы Равена и пространственную задачу на когнитивный контроль. Деление на «бедных» и «богатых» шло по медиане дохода домохозяйства, поделённого на корень из его размера. Объёмы 101, 100 и 96 человек. Головной результат это взаимодействие дохода и трудности: F(1,97) = 5,12 при P = 0,03 и F(1,97) = 7,86 при P меньше 0,01. Величина d, по словам самих авторов, от 0,88 до 0,94. Полевая: 464 фермера сахарного тростника в 54 деревнях округов Виллупурам и Тируваннамалай, опрошенные дважды за четыре месяца 2010 года, до уборки и после. Матрицы Равена 4,35 против 5,45 верного ответа (n = 460), числовая задача Струпа 146 против 131 секунды (n = 452) и 5,93 против 5,16 ошибки (n = 453). Пересчёт «~13 пунктов IQ» сделан по общепринятому приближению при среднем 100 и стандартном отклонении 15. Тестов интеллекта не давали никому.
Wicherts JM, Scholten AZ, печатный комментарий к работе о бедности и когнитивных функциях, Science2013Печатный комментарий и ответ авторов оригинала в том же номере, на той же странице. Комментарий: переанализ без разбиения дохода на две половины находок не подтверждает, а взаимодействия дохода с воздействием названы ложными, ведь их порождает эффект потолка от коротких и лёгких тестов. Вывод комментария: действие финансовых забот не ограничено бедными. Ответ: при непрерывной переменной дохода взаимодействие остаётся устойчивым во всех экспериментах, результаты по задаче на когнитивный контроль эффектом потолка не объясняются, улучшение после уборки устойчиво к обучению. Это не отдельная работа, а обмен двумя документами: своих данных и своего объёма участников у него нет. Полные тексты у издателя закрыты, и в курс идут дословные аннотации.
Carvalho LS, Meier S, Wang SW, American Economic Review2016Рандомизированное назначение момента опроса: участников случайно опрашивали незадолго до зарплаты или вскоре после неё. Объём: 3 821 участник с годовым доходом домохозяйства ниже 40 тысяч долларов, США. В итоговых расчётах 1 056 участников и 20 206 проб в первом исследовании, 2 496 участников и 119 684 пробы во втором. Прибор второго исследования тот же числовой Струп, что и в работе 2013 года, взятый ради прямой сопоставимости. Оценки по логарифму времени реакции: 0,02 при ошибке 0,029 и 0,00 при ошибке 0,011, тогда как пересчёт данных фермеров теми же авторами даёт 0,19 при ошибке 0,036 на 451 наблюдении. Экономический шок при этом крупнее там, где эффекта нет: до зарплаты тратили на 23 и на 48 % меньше против 10 % у фермеров. Найдено смещение к ближнему в выборе между денежными наградами и не найдено в выборе между заданиями на усилие. Данные для пересчёта передали авторы оригинала.
Shah AK, Mullainathan S, Shafir E, самостоятельная репликация собственной работы 2012 года, Journal of Economic Psychology2019Предрегистрированные высокомощные повторения всех экспериментов собственной работы 2012 года, поставленные её же авторами. Повод: масштабный проект репликаций 2018 года не воспроизвёл первый эксперимент той работы. Результат разделён авторами сам: свидетельств в пользу гипотезы о когнитивной усталости от дефицита не нашлось, и результат вышел противоположным исходному. Эксперименты о том, что дефицит ведёт к дорогим займам, воспроизвелись полностью. Повторение пятого эксперимента идёт в ту же сторону, но незначимо и заметно слабее. Общая оговорка авторов: величины эффектов в повторениях часто меньше исходных.
O'Donnell M и др., эмпирический аудит литературы о дефиците, PNAS2021Эмпирический аудит: не проверка одной гипотезы, а повторение куска литературы по объявленным правилам. Отбор: 198 статей, цитирующих опорную работу 2012 года, сужены до 32, отвечающих условиям (дефицит как экспериментальный фактор, воспроизводимость онлайн), из них случайный отбор двадцати. Все методы, расчёты и объёмы предрегистрированы, объём каждой репликации составляет две с половиной величины оригинала. Величина эффекта в репликации меньше оригинальной у 80 % работ и противоположна по знаку у 30 %. Из двадцати значимых оригиналов значимость получили четыре репликации. Про мощность: только у девяти оригиналов интервал включал величину, которую они обнаружили бы с вероятностью хотя бы в треть. Через год вышла опубликованная поправка: одна репликация убрана и переделана, две аналитические ошибки исправлены. Собственная граница названа авторами: вывод касается работ, проведённых онлайн.
Shah AK, Zhao J, Mullainathan S, Shafir E, возражение на эмпирический аудит и ответ на него, PNAS2023Обмен двумя документами в одном номере: возражение и ответ авторов аудита. Четыре претензии возражения: включены работы не о ресурсном дефиците. Собственный критерий отбора не выполнен. Есть аналитические ошибки. Часть репликаций неверна оригиналу. Затронуто этим, по счёту оппонентов, не меньше десяти работ из двадцати. Про репликацию полевой работы 2013 года: одну из двух головных зависимых переменных не измеряли вовсе, а участники на исходном уровне в десять раз чаще работали на уровне случайного угадывания или ниже. Ответ: разнородность признана следствием широких критериев, отклонение от собственного критерия признано прямо, аналитические ошибки признаны и исправлены поправкой, правка на асимметрию отвергнута как принятая после того, как результат увидели. По эпизоду с рождественскими покупками проведены две новые репликации, в марте и ноябре 2022 года, и все три оригинал не воспроизвели.
Szecsi P, Szaszi B, Collabra: Psychology2024Систематический обзор и байесовская многоуровневая мета-регрессия. Предмет: именно взаимодействие финансовых сигналов и бедности в когнитивных показателях. Это не одно исследование, а свод работ: 14 величин эффекта из 10 исследований, своего объёма участников у него нет. Работы, где участники зарабатывали деньги за результат, исключены. Сводная оценка 0,09 при интервале от −0,03 до 0,21, разброс между работами 0,16 с интервалом от 0,09 до 0,29. Байесовский фактор для гипотезы о попадании эффекта в полосу практической эквивалентности плюс-минус 0,1 равен 0,21, что авторы называют умеренным свидетельством против существования эффекта. Тут же две оговорки самих авторов: вывод неустойчив к выбору априорного распределения, а доступных свидетельств крайне мало. Свидетельств за или против выборочной публикации не найдено.
Kaur S, Mullainathan S, Oh S, Schilbach F, Quarterly Journal of Economics2025Полевой эксперимент на собственном производственном участке исследователей: жребием разыгрывали момент выплаты уже заработанного. Объём: 408 низкодоходных мужчин-рабочих сельской Одиши, сдельное изготовление тарелок из листьев, сухой сезон. Шестеро выбыли до конца, их посещаемость и выработка закодированы нулём. Исходы: часовая выработка и следы исправленных ошибок, измеренные незаметно для рабочего. Фон: 70 % рабочих говорят, что очень беспокоятся о деньгах, и отвлекаются на эти заботы в половине рабочих дней. В первые три дня доля погасивших хоть какой-то долг выше на 40 процентных пунктов, суммы платежей выше на 287 %. Выработка на следующий день после выплаты выше на 0,109 стандартного отклонения, то есть на 6,9 % (p = 0,020), и прибавка держится дальше. Следы исправленных ошибок реже на 0,08 стандартного отклонения (p = 0,092), у беднейших на 0,13 (p = 0,037). Повышение сдельной ставки поднимает выработку на 0,020 стандартного отклонения и на внимательность не действует (p различия 0,001). Питание как объяснение отвергнуто прямо: всю еду на участке давали сами исследователи. Числа читаны по рабочей версии NBER 28338.
Bessone P, Rao G, Schilbach F, Schofield H, Toma M, Quarterly Journal of Economics2021Рандомизированное испытание с трёхнедельными вмешательствами. Сон мерили актиграфией, то есть объективно, а не самоотчётом. Объём: 452 взрослых из низкодоходных слоёв Ченнаи. Участникам давали месячную работу по вводу данных с гибким графиком, и на ней мерили производительность и предложение труда. Исходный уровень: спят в среднем 5,5 часа при восьми часах в постели. Предсказание названо заранее: 119 экспертов по науке о сне и по экономике предсказали прирост выработки на 7 % от получаса добавочного ночного сна. Вмешательство подняло сон на 27 минут за ночь, а обнаружимых эффектов на познание, производительность, решения и самочувствие не оказалось. Предложение труда слегка снизилось. Короткий дневной сон на рабочем месте поднял сводный индекс исходов на 0,12 стандартного отклонения, включая производительность, самочувствие и познание, и одновременно сократил рабочее время.

Что подтвердилось, а что нет

мифБедность отнимает тринадцать пунктов IQ.

Так пересказывают строку работы 2013 года, а сама работа этого не говорит. В ней сказано, что наблюдённые эффекты соответствуют примерно тринадцати пунктам IQ по общепринятому приближению исследователей интеллекта при среднем 100 и стандартном отклонении 15. Тестов интеллекта не давали никому. Пересчитана лабораторная величина: от 0,88 до 0,94 на посетителях торгового центра в Нью-Джерси, эксперименты по 96-101 человеку. Полевые оценки на 464 фермерах Тамилнада, измеренные дважды за четыре месяца 2010 года, авторы сами называют равными трём четвертям лабораторной, то есть около десяти пунктов той же шкалы.

отвергнутоФинансовая тревога ухудшает мышление бедных с величиной около девяти десятых стандартного отклонения.

Величина от 0,88 до 0,94 лабораторная, и напечатали её сами авторы работы 2013 года. Свод 2024 года собрал 14 величин эффекта из 10 исследований именно про взаимодействие финансовых сигналов и бедности и дал 0,09 при интервале от −0,03 до 0,21, при разбросе между работами 0,16 с интервалом от 0,09 до 0,29. Это разрыв примерно на порядок. На том же числовом Струпе онлайн-исследование 2016 года на 2 496 участниках с доходом ниже 40 тысяч долларов дало 0,00 при стандартной ошибке 0,011, тогда как пересчёт данных фермеров теми же авторами дал 0,19 (0,036) на 451 наблюдении, причём денежный шок был крупнее там, где эффекта нет. Оговорку авторов свода надо приводить вместе с числом: свидетельств мало, и вывод неустойчив к выбору априорного распределения.

выдержалоДосрочная выплата заработанного повышает выработку у низкодоходных рабочих.

Проверено жребием на 408 низкодоходных мужчинах-рабочих сельской Одиши в сухой сезон: разыгрывали момент выплаты уже заработанного, исходом была часовая выработка на сдельном изготовлении тарелок из листьев. На следующий день после выплаты выработка выше на 0,109 стандартного отклонения, то есть на 6,9 % (p = 0,020), и прибавка держится дальше. Что это не «старались сильнее», проверено вторым исходом, о котором рабочий не знал: следы исправленных ошибок стали реже на 0,08 стандартного отклонения (p = 0,092), у беднейших на 0,13 (p = 0,037), тогда как повышение сдельной ставки поднимает выработку и внимательность не трогает (p различия 0,001). Доверительных интервалов к этим величинам первоисточник в добытой части базы не печатает, и вторую половину результата здесь взять неоткуда. Величина при этом равна семи процентам выработки, а не тринадцати пунктам шкалы интеллекта.

отвергнутоПолчаса добавочного ночного сна повышают выработку у бедных городских работников.

Величину назвали заранее: 119 экспертов по науке о сне и по экономике предсказали прирост выработки на 7 % от получаса добавочного сна. Проверено на 452 взрослых из низкодоходных слоёв Ченнаи, спавших в среднем 5,5 часа при восьми часах в постели. Сон мерили актиграфией, вмешательство длилось три недели, исходами были сон, познание, производительность, решения, самочувствие и предложение труда. Сон вырос на 27 минут за ночь, а обнаружимых эффектов на познание, производительность, решения и самочувствие не оказалось. Предложение труда слегка снизилось. Сработало при этом другое: короткий дневной сон на рабочем месте поднял сводный индекс исходов на 0,12 стандартного отклонения и одновременно сократил рабочее время.

Термины

взаимодействиеinteraction
Зависимость эффекта одного условия от значения другого: воздействие меняет исход не у всех, а у тех, у кого заранее названный признак принимает определённое значение. От главного эффекта отличается тем, что утверждает не «в среднем стало хуже», а «стало хуже там, где признак такой». Проверяется отдельным членом в модели, и значимость считается именно для него.
дихотомизацияmedian split
Превращение непрерывной переменной в две группы разрезом по медиане или другому порогу. Приём удобен для изложения и теряет часть сведений, а иногда порождает связи, которых в непрерывной записи нет. Поэтому у результата, полученного на разрезанной переменной, спрашивают, что выходит на непрерывной.
эффект потолкаceiling effect
Скопление результатов у верхнего края шкалы, когда задача слишком лёгкая или слишком короткая. Различать людей такой прибор перестаёт: разница между ними есть, а измерить её нечем. В сравнении групп это способно и скрыть различие, и создать видимость взаимодействия.
числовая задача Струпаnumerical Stroop task
Задача, где надо назвать, сколько знаков в строке, а не какое число ими написано: строка из трёх пятёрок требует ответа «три». Меряет время реакции и число ошибок при конфликте двух признаков одного и того же знака. В работах о бедности берётся как прибор на текущее состояние внимания, а не как оценка способностей.
эмпирический аудитempirical audit
Проверка не одной работы, а куска литературы сразу: список работ отбирается по объявленным условиям, а затем каждая повторяется по предрегистрированному плану. Отвечает на вопрос о литературе, а не о конкретной гипотезе. Границы такой проверки заданы её же критериями отбора, и потому спор о ней обычно идёт о критериях.
байесовский факторBayes factor
Отношение того, насколько хорошо данные предсказаны одной гипотезой, к тому же для другой. Число меньше единицы говорит в пользу второй гипотезы, больше единицы в пользу первой. Зависит от объявленного заранее априорного распределения, и потому рядом с ним печатают проверку на устойчивость к его выбору.
полоса практической эквивалентностиregion of practical equivalence
Диапазон вокруг нуля, внутри которого эффект объявлен практически незначащим, например плюс-минус одна десятая стандартного отклонения. Задаётся до счёта и по предмету, а не по данным. Позволяет спрашивать не «есть ли эффект», а «отличается ли он от нуля настолько, чтобы это что-то значило».
незаметная мера исходаunobtrusive measure
Исход, который записывается без ведома участника и ничего не требует от него сообщать: следы исправленных ошибок в изделии, отметка времени, автоматическая запись. Не портится от желания понравиться и от того, что человек знает о наблюдении. Стоит рядом с обычным исходом как проверка: если оба двинулись одинаково, объяснение «просто старались сильнее» слабеет.
предсказание экспертовexpert forecast
Опрос специалистов о результате испытания, проведённый до того, как результат стал известен. Даёт линейку для чтения нуля: если названная заранее величина не подтвердилась, ноль становится содержательным ответом, а не пустым местом. И показывает заодно, что именно поле считало очевидным.

Практикум · Проверить одну величину на пересчёт

Упражнение на сорок минут и на одно громкое число о людях: в новости, в лекции, в отчёте. Считать почти ничего не нужно, решать что-либо не нужно вовсе. Цель одна: увидеть, чем именно получено число, прибором или пересчётом в другую шкалу.

  1. Выпишите величину дословно вместе с единицей: пункты, проценты, стандартные отклонения, секунды, килограммы. Отдельно отметьте, стоит ли рядом интервал или стандартная ошибка.
  2. Найдите в первоисточнике, каким прибором мерили исход, и выпишите этот прибор. Если единица в пересказе и прибор в работе не совпадают, между ними стоит пересчёт. Найдите правило, по которому он сделан.
  3. Проверьте, лабораторная это величина или полевая. У работы 2013 года они разные, и авторы сами пишут, что полевая равна трём четвертям лабораторной.
  4. Посмотрите, главный это эффект или взаимодействие. Выпишите словами, у кого и при каком условии эффект наблюдался, и сверьте это с заголовком пересказа.
  5. Найдите судьбу работы: были ли комментарий, поправка, репликация, свод. Выпишите по каждой претензии, что с ней стало, и не заменяйте этот список счётом «столько-то из стольких-то».

Вопросы для самопроверки

Вопрос 1

Что означает величина «~13 пунктов IQ» в работе 2013 года?

  • Средний балл теста интеллекта у фермеров до уборки оказался на тринадцать пунктов ниже, чем после неё
  • Пересчёт величины эффекта в стандартных отклонениях в шкалу со средним 100 и разбросом 15
  • Разницу между «бедной» и «богатой» половинами выборки торгового центра на матрицах Равена
  • Сводную оценку по четырнадцати величинам эффекта из десяти исследований
Вопрос 2

Чем головной результат лабораторной части отличается от того, как его обычно пересказывают?

  • Он состоит во взаимодействии дохода и трудности сценария, а не в том, что бедные решают хуже сами по себе
  • Он получен на выборке из трёх с лишним тысяч человек, а не на сотне посетителей торгового центра
  • Он относится к скорости ответа, а не к числу верных ответов на матрицах Равена
  • Он оказался значимым только после поправки на множественность проверок
Вопрос 3

Почему расхождение между онлайн-исследованием 2016 года и полевой работой нельзя списать на слабость денежного шока?

  • Потому что участников в онлайн-исследовании было вдвое больше, а объём выборки на величину эффекта не влияет
  • Потому что онлайн-исследование мерило другим прибором, и сравнивать эти две оценки между собой некорректно
  • Потому что участники онлайн-исследования были беднее индийских фермеров по паритету покупательной способности
  • Потому что шок там был крупнее: до зарплаты тратили на 23 и 48 % меньше
Вопрос 4

Как правильно передать спор об аудите двадцати репликаций?

  • Аудит опроверг литературу о дефиците: значимыми остались четыре работы из двадцати
  • Возражение опровергло аудит: не меньше десяти его репликаций из двадцати оказались негодными
  • Списком претензий и того, что стало с каждой: часть признана и исправлена, часть отбита обеими сторонами
  • Спор так и остался неразрешённым, потому что ни одна из сторон не признала ни одной собственной ошибки по существу
Вопрос 5

Что из перечисленного НЕ следует из испытания с досрочной выплатой в Одише?

  • Что выработка выросла на 6,9 % на следующий день после выплаты
  • Что финансовые заботы отнимают у бедных около тринадцати пунктов шкалы интеллекта
  • Что рабочие в первые три дня гасили долги: доля погасивших выше на 40 процентных пунктов
  • Что дело не в одном старании: следы исправленных ошибок стали реже, а сдельная ставка на них не действует

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Mani A., Mullainathan S., Shafir E., Zhao J. «Poverty impedes cognitive function». Science, 2013, 341(6149):976-980: У издателя закрыта. Открытая копия лежит на странице Э. Шафира в Принстоне. Главная для этого урока строка не в аннотации, а в абзаце «How large are these effects?»: там и сравнение с бессонной ночью, и оговорка про общепринятое приближение, и «три четверти» для полевых оценок.
  • Carvalho L.S., Meier S., Wang S.W. «Poverty and Economic Decision-Making: Evidence from Changes in Financial Resources at Payday». American Economic Review, 2016, 106(2):260-284: Открыта полностью в PMC (PMC5167530). Читать стоит седьмую таблицу и следом абзац о сведении оценок: там посчитано, во сколько раз должен быть крупнее шок, чтобы числа сошлись, и сказано, что при разных знаках они не сходятся вовсе.
  • O'Donnell M. и соавторы. «Empirical audit and review and an assessment of evidentiary value in research on the psychological consequences of scarcity». PNAS, 2021, 118(44):e2103313118: Открыта (PMC8612349), и читать её надо вместе с опубликованной поправкой PNAS 2022, 119(48):e2217321119, а в поправке перечислены две исправленные аналитические ошибки и убранная репликация. Строка про мощность оригиналов стоит в результатах, а не в аннотации.
  • Shah A.K., Zhao J., Mullainathan S., Shafir E. «A scarcity literature mischaracterized with an empirical audit». PNAS, 2023, 120(26):e2206054120: Открыта (PMC10293841), и читать её надо вместе с ответом в том же номере, PNAS 120(26):e2304251120. Четыре претензии перечислены списком в начале. Полезнее всего разбор репликации полевой работы, где названо, какой из двух головных исходов не измерялся.
  • Szecsi P., Szaszi B. «Financial-Scarcity-Related Cues' Impact on the Cognitive Performance of the Poor: A Meta-analysis». Collabra: Psychology, 2024, 10(1):122943: Открыта, авторская копия лежит в репозитории ELTE. Числа 0,09 и 0,16 стоят в аннотации, а важнее их две соседние фразы: вывод неустойчив к выбору априорных распределений, и доступных свидетельств в литературе крайне мало.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Борьба с бедностью»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?