Регрессия к среднему
Почему после провала обычно становится лучше, даже если ничего не делать
Регрессионная прямая это правило наилучшего предсказания одной величины по другой: она проходит через точку средних, а её наклон равен корреляции, умноженной на отношение стандартных отклонений. Возвращение к среднему даёт неполная корреляция, а не какой-то процесс: у отобранных по крайнему значению предсказание сдвигается к центру, поэтому после провала обычно становится лучше. Отделить эффект от возврата позволяет только группа сравнения.
MIT 18.05, занятие 26 · Data 8, гл. 15-16 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Строить регрессионную прямую как правило предсказания и читать её наклон на числах
- Различать сравнение между объектами и утверждение о том, что даст изменение
- Выводить возвращение к среднему из неполной корреляции, без психологических объяснений
- Опознавать выводы, которые держатся на отборе экстремальных случаев
Две контрольные подряд по одной программе, одна и та же группа, между ними не происходило ничего: ни разбора ошибок, ни дополнительных занятий. Средний балл на обеих равен 60, стандартное отклонение 10, корреляция между результатами 0,6.
Ученик написал первую на 80, то есть на два стандартных отклонения выше среднего. Наилучшее предсказание для его второй работы: 60 + 0,6 × 2 × 10 = 72. У тех, кто написал первую на 40, предсказание равно 48. Сильные в среднем упадут, слабые в среднем поднимутся, притом что не изменилось ровно ничего.
Теперь достаточно объявить, что со слабыми поработали, и предъявить их рост с 40 до 48 как результат работы. Вывод не будет опираться ни на что: ровно столько же дало бы полное бездействие.
Урок о прямой, которая делает это предсказание, о том, что означает её наклон, и о целом классе выводов, которые этим наблюдением разрушаются.
Прямая, которая предсказывает
Задача регрессии формулируется узко: по значению одной величины назвать наилучшую догадку о второй. Из всех прямых выбирается та, у которой сумма квадратов вертикальных отклонений точек от неё минимальна. Отсюда название метод наименьших квадратов. Квадраты, а не сами отклонения, потому что иначе промахи в разные стороны взаимно погасились бы и подошла бы почти любая прямая.
Считать эту прямую вручную не нужно: она полностью определяется четырьмя числами, которые уже знакомы. Наклон равен коэффициенту корреляции, умноженному на отношение стандартных отклонений: сначала второй величины, потом первой. Прямая проходит через точку, где обе величины равны своим средним. Этого достаточно, чтобы найти и второй параметр.
Пример на числах. В выборке сотрудников средний стаж 6 лет при стандартном отклонении 4 года, средняя зарплата 90 тысяч при стандартном отклонении 30 тысяч, корреляция стажа и зарплаты 0,5. Наклон: 0,5 × 30 / 4 = 3,75 тысячи на год стажа. Прямая проходит через точку (6, 90), значит, при нулевом стаже она даёт 90 − 3,75 × 6 = 67,5. Правило предсказания готово: зарплата равна 67,5 плюс 3,75 за каждый год стажа.
Проверим на двух значениях. Стаж 10 лет: 67,5 + 37,5 = 105 тысяч. Стаж 6 лет: 67,5 + 22,5 = 90, то самое среднее, как и должно быть. Если человек со стажем 10 лет получает 120, его остаток равен +15 тысячам: столько прямая не объяснила. Остатки и есть то, ради минимизации чего прямая построена, и смотреть на них полезнее, чем на сам наклон: если они систематически положительны на одном участке и отрицательны на другом, связь не прямая, а прямой её описали.
Если обе величины перевести в стандартные единицы, наклон прямой становится равен просто коэффициенту корреляции. Правило читается одной фразой: отклонение первой величины на одно стандартное отклонение соответствует отклонению второй на r стандартных отклонений. Вся формула наклона это та же фраза, переведённая обратно в исходные единицы.
Что означает наклон и чего он не означает
Наклон 3,75 допускает ровно одно корректное прочтение: среди этих сотрудников те, кто отличается стажем на год, отличаются зарплатой в среднем на 3,75 тысячи. Это утверждение о сравнении людей между собой.
Оно легко подменяется другим: если конкретный человек проработает ещё год, он станет получать на 3,75 больше. Второе утверждение говорит о вмешательстве и из данных не следует. Люди с разным стажем отличаются не только стажем: у них другой возраст, другие должности, они нанимались в разные годы по разным ставкам, и часть из тех, кто пришёл давно и мало получал, уже уволилась. Прямая суммирует, чем различаются наблюдения, а менять что-либо она не обещала.
Различение сравнения и вмешательства служит стержнем всего модуля, и к нему курс возвращается в семнадцатом уроке. Пока достаточно правила формулировки: говорить «различаются в среднем на», а не «даёт» или «приводит к». Первый оборот описывает то, что действительно посчитано.
Регрессию сопровождает второе число, квадрат коэффициента корреляции. При r = 0,5 он равен 0,25, и обычно его называют долей объяснённой дисперсии. Точный смысл скромнее: средний квадрат ошибки при предсказании по прямой составляет 75 % от того, который получился бы при предсказании одним только средним. В единицах самой величины выигрыш ещё заметнее теряется: типичная ошибка сокращается примерно на 13 %. Слово «объяснённой» здесь чисто техническое и никакого объяснения не содержит.
И третье ограничение это экстраполяция. Наша прямая при стаже 30 лет обещает 180 тысяч, а при стаже 40 даёт 217,5. Данных в этой области нет, форма связи там неизвестна, и продолжать прямую туда не расчёт, а фантазия в оформлении расчёта. Прямая описывает диапазон, на котором построена, и заканчивается вместе с ним.
Возвращение к среднему
Теперь главное свойство этой конструкции, из-за которого она когда-то и получила своё название. Предсказание всегда ближе к среднему, чем исходное отклонение, и так во всех случаях, кроме идеальной корреляции. Балл 80 при среднем 60 даёт предсказание 72, а не 80. Это не осторожность метода, а прямое следствие того, что связь неполная.
Механизм виден на модели, которую можно просчитать целиком. Пусть результат складывается из двух частей: постоянного умения, равного для человека числу от 1 до 6, и удачи, то есть броска кубика. Среднее умения 3,5, среднее броска 3,5, средний результат 7.
Кто получил максимальные 12? Только тот, у кого умение 6 и выпала шестёрка: другого способа набрать 12 нет. В следующий раз умение то же самое, а бросок в среднем даст 3,5, и ожидаемый результат равен 9,5. Кто получил 2? Только человек с умением 1, которому выпала единица. В следующий раз ожидается 4,5. Оба крайних результата сдвинулись к семёрке, и никто ничего не делал: кубик не помнит прошлого броска, а умение не изменилось.
Причина в отборе. Крайние значения набираются двумя способами сразу: настоящим отличием и удачным совпадением. Первая часть повторится, а вторая нет, поэтому во втором измерении остаётся только она. Чем слабее корреляция между двумя измерениями, тем сильнее сдвиг к центру. При корреляции 1 сдвига нет вовсе, при корреляции 0 предсказание для любого человека сводится просто к среднему.
Есть тонкость, без которой явление понимают неверно. Возвращение к среднему не означает, что разброс со временем сжимается и все сходятся к одному. Распределение вторых результатов имеет тот же разброс, что первых: просто крайние места в нём занимают уже другие люди, которым повезло на этот раз. Сдвигается к центру не группа, а предсказание для тех, кого отобрали по крайнему значению.
Если объекты для вмешательства отобраны по экстремальному значению того же показателя, которым потом измеряется успех, то возвращение к среднему обеспечено, и часть улучшения к вмешательству отношения не имеет. Худшие филиалы, отстающие классы, пациенты в худший день болезни, отделения с всплеском осложнений: везде отбор идёт по показателю, а результат читается по нему же.
Куда это бьёт
Классическим случаем служит обучение с обратной связью. Инструктор разбирает исполнение: за неудачное отчитывает, за отличное хвалит. Наблюдение накапливается быстро: после разноса следующая попытка обычно лучше, после похвалы обычно хуже. Отсюда вывод, что порицание работает, а поощрение расслабляет.
Оба наблюдения верны, и оба ничего не говорят о действенности разноса и похвалы. Отчитывают после худшей попытки, то есть после экстремально низкого значения, за которым в среднем идёт более высокое. Хвалят после лучшей, а за ней в среднем идёт более низкое. Ту же картину дала бы полностью молчащая инструкция, и различить два объяснения по этим данным невозможно. Заметьте, куда ведёт ошибка: она систематически подталкивает к порицанию, и опыт её только укрепляет.
Тот же механизм с лечением. Пример учебный, числа придуманы. Средство от простуды начинают принимать не в случайный день, а в самый тяжёлый. Дальше становится лучше почти всегда, потому что худший день на то и худший. Без группы сравнения из такого наблюдения не следует ничего, и это одна из причин, по которым испытания устроены так, как устроены.
Везде отбор идёт по крайнему значению: второй сезон после выдающегося первого, второй роман после нашумевшего дебюта, вторая половина года после рекордного квартала. Последующее снижение объявляется то усталостью, то самоуспокоенностью, то давлением ожиданий. Все эти объяснения могут быть верны, но проблема в том, что снижение произошло бы и без них.
Наконец, самая дорогая версия встречается в управлении. Берутся десять худших по показателю подразделений, в них проводится вмешательство, через квартал показатель в среднем растёт, вмешательство признаётся успешным и тиражируется. Вернёмся к числам из начала урока: у отобранных с баллом 40 ожидаемый второй результат равен 48 без всякого вмешательства. Если после занятий получилось 52, эффект занятий составляет четыре балла, а не двенадцать. Расчёт возможен именно потому, что известна корреляция между двумя измерениями. Без неё остаётся единственный надёжный ход, а именно группа сравнения, отобранная по тому же правилу и не получившая вмешательства.
Ни в кубиках, ни в двух контрольных нет мотивации, самоуспокоенности и давления ожиданий, а возвращение к среднему есть. Психологические объяснения могут добавляться к нему, но не могут его заменить: сначала надо вычесть то, что даёт сам отбор по крайнему значению, и только остаток обсуждать содержательно.
Две прямые вместо одной
Есть наблюдение, которое окончательно закрывает вопрос о том, процесс это или свойство расчёта. Прямая для предсказания второй величины по первой и прямая для предсказания первой по второй это разные прямые, совпадающие только при корреляции, равной единице.
Проверим на нашей группе. Написавший первую контрольную на 80 ожидается на второй с результатом 72, ближе к среднему. Возьмём теперь того, кто написал на 80 вторую: наилучшее предсказание для его первой работы даёт те же 72. То есть отклонение сглаживается и назад во времени тоже.
Никакой процесс не действует в прошлое, значит, никакого процесса нет. Есть свойство неполной связи: крайнее значение любой из двух величин частично набрано случайной составляющей, которая во второй величине не повторяется, в какую сторону ни смотри.
Отсюда итог урока в двух строках. Регрессионная прямая служит компактным правилом предсказания, честным в том диапазоне, где построена, и молчащим о том, что случится при вмешательстве. Возвращение к среднему не эффект, не тенденция и не закон природы, а арифметическое следствие того, что корреляция меньше единицы. Оба вывода нужны для следующих двух уроков, где речь пойдёт уже прямо о причине: сначала о факторах, которые подменяют связь, потом о том, что вообще позволяет говорить о влиянии.
Ключевые работы
| Adhikari, DeNero, Wagner, «Computational and Inferential Thinking» | 2022 | Главы 15-16: регрессия в стандартных единицах, наклон как корреляция, остатки и их диагностика. Вывод для регрессии строится бутстрапом, а не формулами. |
| Orloff, Kamrin, MIT 18.05 «Introduction to Probability and Statistics» | 2022 | Занятие 26, простая и множественная регрессия: метод наименьших квадратов, смысл коэффициентов и границы их интерпретации. |
Что здесь путают
Если объекты отобраны по экстремально плохому значению показателя, улучшение ожидается и без вмешательства: часть крайнего значения набрана случайной составляющей, которая не повторяется. В примере урока у отобранных с баллом 40 ожидаемый второй результат равен 48 при полном бездействии. Вывод об эффекте требует либо группы сравнения, отобранной по тому же правилу, либо расчёта ожидаемого возврата по корреляции между измерениями.
Объяснение не обязательно ложно, но оно избыточно: спад произошёл бы и без него. В модели, где результат складывается из постоянного умения и броска кубика, набравший максимальные 12 в следующий раз ожидается на 9,5, при том что у кубика нет ни мотивации, ни ожиданий. Порядок действий обратный привычному: сначала вычесть то, что даёт сам отбор по крайнему значению, и обсуждать содержательно только остаток.
Наклон описывает, чем в среднем отличаются наблюдения, отличающиеся на единицу. Это сравнение, а не вмешательство. Люди с разным стажем различаются возрастом, должностями и годом найма, и прямая суммирует все эти различия сразу. Прочтение через изменение допустимо только тогда, когда обосновано отдельно: рандомизацией или разбором смешивающих факторов. Формулировка «различаются в среднем на» описывает ровно то, что посчитано, и не обещает лишнего.
Термины
- регрессионная прямаяregression line
- Прямая, дающая наилучшее предсказание одной величины по другой. Проходит через точку средних.
- метод наименьших квадратовleast squares
- Правило выбора прямой: минимизируется сумма квадратов вертикальных отклонений точек от неё.
- наклонslope
- Изменение предсказания при увеличении первой величины на единицу. Равен корреляции, умноженной на отношение стандартных отклонений.
- остатокresidual
- Разность между наблюдённым значением и предсказанием прямой. Систематика в остатках означает, что связь не линейна.
- коэффициент детерминацииcoefficient of determination, R²
- Квадрат корреляции. Доля, на которую предсказание по прямой уменьшает средний квадрат ошибки по сравнению с предсказанием средним.
- регрессия к среднемуregression to the mean
- Сдвиг предсказания к центру для объектов, отобранных по крайнему значению. Следствие неполной корреляции, а не процесс.
- заблуждение регрессииregression fallacy
- Приписывание вмешательству того улучшения, которое даёт сам отбор по экстремальному значению.
- экстраполяцияextrapolation
- Продолжение прямой за пределы диапазона данных. Форма связи там не проверена, и предсказание ничем не обеспечено.
- группа сравненияcontrol group
- Объекты, отобранные по тому же правилу, но не получившие вмешательства. Единственный общий способ отделить эффект от возврата к среднему.
Практикум · Сколько улучшения дал сам отбор
Задача в том, чтобы посчитать возврат к среднему на своих данных и отделить его от возможного эффекта. Нужен любой показатель, измеренный дважды у десяти и более объектов: продажи по филиалам за два месяца, время задач по исполнителям за два спринта, оценки по ученикам за две работы, шаги по дням недели за две недели.
- Соберите таблицу: не меньше десяти объектов, по два измерения на каждый. Посчитайте среднее и стандартное отклонение отдельно для первого и второго измерения.
- Посчитайте корреляцию между двумя измерениями так же, как в прошлом уроке: средний продукт отклонений, делённый на произведение стандартных отклонений.
- Отберите три объекта с худшими значениями в первом измерении. Для каждого посчитайте предсказание по правилу: среднее второго измерения плюс корреляция, умноженная на отклонение от первого среднего и на отношение стандартных отклонений.
- Сравните предсказания с тем, что у этих трёх объектов вышло на самом деле. Разница между фактом и предсказанием и есть то, что не объясняется возвратом к среднему. Всё остальное улучшение объясняется им.
- Повторите шаги 3 и 4 для трёх лучших объектов и запишите один вывод: какую долю наблюдаемого изменения у крайних объектов даёт сам отбор и какая группа сравнения понадобилась бы, чтобы говорить об эффекте.
Вопросы для самопроверки
Средний балл на обеих контрольных 60, стандартное отклонение 10, корреляция между ними 0,6. Ученик написал первую на 80. Каково наилучшее предсказание для второй?
- 80
- 88
- 60
- 72
Десять худших по выручке филиалов получили нового руководителя, через квартал их средняя выручка выросла. Что отсюда следует?
- Замена руководителя работает: рост зафиксирован в тех же филиалах и по тому же показателю, что и падение
- Часть роста даёт сам отбор по худшему значению, и величина эффекта неизвестна
- Рост случаен, и эффекта нет: возвращение к среднему объясняет наблюдаемое целиком
- Вывод корректен, если филиалов достаточно много: при большом числе объектов случайная составляющая усредняется
Наклон регрессии зарплаты на стаж равен 3,75 тысячи на год. Какое прочтение корректно?
- Каждый отработанный год добавляет сотруднику 3,75 тысячи
- Через год работы зарплата вырастет на 3,75 тысячи
- Сотрудники, отличающиеся стажем на год, отличаются зарплатой в среднем на 3,75 тысячи
- Стаж объясняет 3,75 тысячи разброса зарплат
Верно ли, что из-за регрессии к среднему разброс результатов со временем сокращается и все сближаются?
- Нет: разброс второго измерения тот же, просто крайние места занимают другие объекты
- Да, но только при корреляции меньше 0,5: при более тесной связи сжатия разброса не происходит
- Да, именно это и означает возвращение к среднему: каждое следующее измерение ближе к центру, чем предыдущее
- Нет, потому что возвращение к среднему действует только на слабых: сильные закрепляют результат и к центру не сдвигаются
Корреляция между двумя величинами 0,5, коэффициент детерминации 0,25. Как это читается?
- В четверти случаев предсказание по прямой оказывается верным
- Четверть наблюдений лежит точно на прямой
- Первая величина объясняет четверть второй
- Предсказание по прямой уменьшает средний квадрат ошибки на четверть, а типичную ошибку примерно на 13 %
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», главы 15-16: Предсказание и вывод для регрессии. Наклон через стандартные единицы и оценка его неопределённости бутстрапом.
- MIT 18.05, конспект занятия 26: Простая и множественная регрессия с формальной стороны, включая смысл остатков.