Корреляция простыми словами
Одно число, из которого выводят больше, чем в нём есть
Коэффициент корреляции равен среднему произведению стандартизованных значений двух величин: он лежит между −1 и 1 и измеряет только линейную согласованность. Нулевая корреляция совместима с жёсткой зависимостью: для пар, где вторая величина это точный квадрат первой, коэффициент равен ровно нулю. Кроме нелинейности он не видит выбросов, способных изменить знак результата, и ограничения размаха, занижающего связь.
MIT 18.05, занятие 7 · Data 8, гл. 15 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Читать коэффициент корреляции как меру линейной связи и только линейной
- Показывать на числах, что нулевая корреляция совместима с жёсткой зависимостью
- Проверять, насколько результат держится на отдельных наблюдениях и на размахе выборки
- Формулировать, при каких условиях корреляция становится свидетельством о причине
Пять пар чисел. Первая величина принимает значения −2, −1, 0, 1 и 2, а вторая равна квадрату первой: 4, 1, 0, 1, 4.
Связь здесь не просто сильная, она полная. Зная первое число, второе можно назвать точно, без всякой погрешности, без единого исключения. Коэффициент корреляции для этих пяти пар равен ровно нулю.
Проверяется это в уме. У первой величины среднее 0, у второй 2. Отклонения от средних у первой такие: −2, −1, 0, 1, 2. У второй они 2, −1, −2, −1, 2. Произведения по парам: −4, 1, 0, −1, 4. Сумма даёт ноль. Корреляция вычисляется из этой суммы, значит, и она ноль.
Урок о том, что именно измеряет это число, чего оно не видит и почему на нём выстроена самая заезженная фраза о статистике.
Что коэффициент корреляции считает
Определение проще, чем кажется, если вспомнить стандартизацию из третьего урока: у каждого значения вычитаем среднее и делим на стандартное отклонение, получая расстояние до центра в единицах типичного разброса. Коэффициент корреляции это среднее произведение стандартизованных значений двух величин по всем наблюдениям.
Почему такая конструкция что-то измеряет. Если оба значения в паре по одну сторону от своих средних, произведение положительное. Если по разные, оно отрицательное. Когда пары систематически ведут себя одинаково, положительные произведения накапливаются, и среднее уходит вверх. Когда одна величина выше своего центра, а другая ниже, накапливаются отрицательные. Когда никакой системы нет, плюсы и минусы гасят друг друга и среднее оказывается около нуля.
Посчитаем на пяти наблюдениях. Часы подготовки: 1, 2, 3, 4, 5. Балл за контрольную: 60, 62, 64, 68, 66. Среднее часов равно 3, отклонения −2, −1, 0, 1, 2, сумма квадратов 10, дисперсия 2, стандартное отклонение около 1,41. Средний балл равен 64, отклонения −4, −2, 0, 4, 2, сумма квадратов 40, дисперсия 8, стандартное отклонение около 2,83.
Произведения отклонений: 8, 2, 0, 4, 4. Сумма 18, среднее 3,6, и это ковариация. Делим её на произведение двух стандартных отклонений: 1,41 × 2,83 = 4, и получаем 3,6 / 4 = 0,9. Число безразмерное и всегда лежит между −1 и 1. Значение 1 означает, что все точки лежат ровно на одной возрастающей прямой, значение −1 указывает на убывающую, а 0 говорит, что линейной согласованности нет.
Из деления на стандартные отклонения следует важное свойство: корреляция не меняется при линейном преобразовании любой из величин. Переведите баллы в проценты, сантиметры в дюймы, рубли в тысячи рублей, вычтите из всех значений константу. Числитель и знаменатель умножатся на одно и то же, и 0,9 останется 0,9. Полезно и как проверка: если чей-то показатель связи меняется от смены единиц измерения, это не корреляция.
Ковариация это тот же средний продукт отклонений, но без деления на стандартные отклонения. Она измеряет то же самое и почти непригодна для чтения: её величина зависит от единиц, в которых записаны обе величины. Ковариация роста и веса в сантиметрах и килограммах и она же в метрах и граммах дают разные числа при одной и той же связи. Корреляция и есть ковариация, приведённая к сопоставимому виду.
Первое, чего она не видит: всё нелинейное
Вернёмся к примеру из начала урока. Ноль получился не потому, что данные шумные, а потому, что зависимость симметрична относительно центра: слева от нуля величины движутся навстречу друг другу, справа идут вместе, и вклады взаимно уничтожаются. Коэффициент честно сообщает, что прямая здесь ничего не описывает. О том, что данные ложатся на идеальную параболу, он сказать не способен, потому что и не предназначен.
Такая форма не экзотика учебника. Зависимость с оптимумом встречается всюду: доза препарата и польза, температура и урожай, нагрузка и производительность, цена и выручка. Во всех случаях есть точка, после которой рост становится вредом, и во всех случаях коэффициент корреляции, посчитанный по всему диапазону, будет близок к нулю при том, что связь жёсткая и хорошо известна.
Отсюда практическое следствие, которое стоит держать первым: корреляция около нуля означает отсутствие линейной связи, а не отсутствие связи. Утверждение «мы посчитали корреляцию, она 0,03, связи нет» некорректно ровно настолько, насколько заранее не проверена форма зависимости. И проверяется она не другим числом, а графиком: точки на плоскости, сто наблюдений, десять секунд взгляда.
Число сжимает облако точек до одной характеристики и по построению теряет всё остальное: форму, разрывы, скопления, отдельные далёкие наблюдения. График не заменяет коэффициент, но коэффициент без графика становится утверждением, за которое нельзя отвечать. Если данные чужие и графика нет, разумно потребовать его прежде, чем обсуждать величину связи.
Второе: одна точка решает
Возьмём девять наблюдений, образующих правильную решётку: первая величина принимает значения 1, 2 и 3, вторая тоже 1, 2 и 3, и представлены все девять сочетаний. Корреляция здесь равна нулю по соображениям симметрии: для каждой пары с положительным произведением отклонений есть зеркальная с отрицательным.
Добавим десятое наблюдение: пару (10, 10). Средние обеих величин становятся 2,8. Сумма произведений отклонений превращается в 57,6. Суммы квадратов отклонений дают 63,6 у каждой величины, и коэффициент получается 0,91. Из нуля в девять десятых от одной точки.
Обратное так же легко. Девять пар (1, 1), (2, 2) и далее до (9, 9) лежат на идеальной прямой, корреляция равна 1. Добавим десятую пару (10, −20), и коэффициент становится примерно −0,23. Не просто ослабевает: меняет знак. Девять наблюдений из десяти по-прежнему на прямой, а число сообщает о слабой обратной связи.
Механизм понятен из определения: в среднее произведение отклонений наблюдение входит своим отклонением, а далёкая точка имеет огромное отклонение по обеим величинам, и её вклад перевешивает всё остальное. Формально это то же свойство, из-за которого среднее чувствительно к выбросам, но здесь оно опаснее, потому что результат подаётся как характеристика связи, а оказывается характеристикой одного наблюдения.
Против власти одной точки есть готовое средство, и стоит оно одной операции. Замените значения их порядковыми номерами: самое маленькое становится первым, следующее вторым и так далее. Посчитайте коэффициент уже по номерам. Это ранговая корреляция Спирмена. Далёкая точка перестаёт быть далёкой: вместо −20 в паре (10, −20) стоит просто «самый маленький», и весит это наблюдение столько же, сколько любое другое. На тех же десяти парах ранговый коэффициент даёт около 0,45 вместо −0,23: знак он сохраняет, хотя связь и слабеет. Заодно он улавливает любую монотонную связь, а не только линейную: если вторая величина растёт вместе с первой, ранги это увидят, как бы ни изгибалась кривая.
Границы у средства тоже понятные, и знать их надо сразу. О крутизне связи ранги не говорят ничего. Порядковые номера не помнят, на сколько именно отличались значения. И параболу из начала урока они не спасают: там связь не монотонна, слева величины расходятся, справа сходятся, и по рангам получается тот же ноль. Против нелинейности с оптимумом работает по-прежнему график, а не другой коэффициент.
Правило чтения: любой коэффициент корреляции должен сопровождаться ответом на вопрос, что с ним станет без самой далёкой точки. Если ответ неизвестен, результат не проверен. Если ответ «изменится вдвое», это надо сообщать, а не выбирать удобный вариант.
На выборке в десять наблюдений одно значение отвечает за десятую часть каждой суммы, поэтому корреляции по малым выборкам гуляют чудовищно. Величина коэффициента сама по себе не говорит о надёжности: 0,7 по восьми точкам и 0,7 по восьми тысячам несут совершенно разные сообщения, и различает их не коэффициент, а интервальная оценка, о которой шла речь в восьмом уроке.
Третье: размах выборки и крутизна связи
Есть свойство, из-за которого корреляции разных исследований несопоставимы даже при одинаковой связи. Коэффициент зависит от того, насколько широко разбросана первая величина в конкретных данных.
Возьмём те же пять пар (часы 1, 2, 3, 4, 5 и баллы 60, 62, 64, 68, 66) и оставим только три последние: часы 3, 4, 5, баллы 64, 68, 66. Считаем заново. Среднее часов 4, отклонения −1, 0, 1, дисперсия 2/3. Средний балл 66, отклонения −2, 2, 0, дисперсия 8/3. Средний продукт отклонений 2/3, произведение стандартных отклонений 4/3, коэффициент 0,5 вместо 0,9. Данные те же самые, никакая пара не изменилась, но диапазон сузился.
Это и есть ограничение размаха, и оно объясняет целый класс недоразумений. Связь вступительного теста с успеваемостью, измеренная среди принятых, всегда слабее, чем среди всех подавших: принимали как раз по тесту, поэтому среди принятых остались только высокие значения. Слабая корреляция в такой выборке не свидетельствует о бесполезности теста, а свидетельствует, что выборка отобрана по нему же.
И последнее из того, чего корреляция не сообщает: она не измеряет крутизну связи. Коэффициент 0,9 говорит, что точки плотно лежат вдоль прямой, и ничего не говорит о наклоне этой прямой. Два исследования могут дать одинаковые 0,9, притом что в одном лишний час подготовки соответствует двум баллам, а в другом двадцати. Величина, отвечающая за наклон, вводится в следующем уроке, и путать её с корреляцией это распространённая и дорогая ошибка: «связь сильная» и «эффект большой» говорят о разном.
Когда корреляция всё-таки говорит о причине
Теперь о фразе, которую произносят чаще любой другой в разговорах о статистике. Она верна: из наличия связи не следует, что одно порождает другое. Беда в том, что ею разговор обычно заканчивают, а на самом деле она его начинает.
Наблюдаемая связь между двумя величинами допускает ровно пять объяснений, и полезно уметь перечислять их вслух. Первое: первая величина влияет на вторую. Второе: вторая влияет на первую, обратное направление отбрасывают чаще, чем следует. Третье: обе зависят от чего-то третьего, что не измеряли. Этому посвящён шестнадцатый урок. Четвёртое: связь порождена отбором в данные, то есть тем, как объекты попали в выборку. Это второй урок. Пятое: случайность, если наблюдений мало или сравнений было много.
Содержательная работа состоит в том, чтобы для конкретной связи разобрать все пять и сказать, что именно позволило бы их различить. Иногда ответ прост: если первая величина измерена раньше второй, обратное направление отпадает. Иногда достаточно рандомизации, тогда третье объяснение исключается по построению, и это тема семнадцатого урока. Иногда общий фактор назвать можно, но измерить нельзя, и тогда честный вывод в том, что связь совместима с причинной гипотезой и не является её подтверждением.
Отсюда и статус самого лозунга. Как утверждение о логике он выдерживает. Как реплика в разговоре он сильно ослаблен, потому что употребляется для прекращения обсуждения там, где обсуждение только требуется. Корреляция при определённых условиях является свидетельством о причине, и содержательный вопрос всегда один: каковы эти условия и выполнены ли они здесь.
Симметричное заблуждение стоит назвать сразу же. Отсутствие корреляции точно так же не означает отсутствия причинной связи: она может быть нелинейной, как в примере с параболой, или разнонаправленной в двух подгруппах, которые в объединённых данных гасят друг друга. Ноль в этой клетке таблицы не отрицательный результат, а отсутствие результата.
«Корреляция не означает причинности» в разговорном употреблении работает как универсальное возражение, не требующее знания предмета: его можно произнести о любом результате, ничего о нём не выяснив. Вместо неё полезнее спросить: какое из пяти объяснений связи здесь наиболее правдоподобно и какие данные его бы исключили. Первая формулировка заканчивает разговор, вторая делает его содержательным.
Ключевые работы
| Adhikari, DeNero, Wagner, «Computational and Inferential Thinking» | 2022 | Глава 15: корреляция вводится через стандартные единицы (коэффициент как среднее произведение стандартизованных значений), с разбором нелинейных случаев и влияния выбросов. |
| Orloff, Kamrin, MIT 18.05 «Introduction to Probability and Statistics» | 2022 | Занятие 7: ковариация и корреляция как характеристики совместного распределения двух случайных величин. Независимость влечёт нулевую корреляцию, обратное неверно. |
Что здесь путают
Как утверждение о логике вывода фраза верна и остаётся верной. Как реплика в разговоре она работает против понимания: её произносят и на этом останавливаются, тогда как связь допускает пять разных объяснений, и разбор состоит в том, чтобы перебрать их и назвать различающие данные. Корреляция при определённых условиях является свидетельством о причине. Содержательный вопрос в том, каковы условия и выполнены ли они. Универсальность возражения и есть его слабость: оно применимо к любому результату без знания предмета.
Коэффициент измеряет только линейную согласованность. Для пяти пар, где вторая величина равна квадрату первой, он равен ровно нулю при полной, без единого исключения, зависимости. То же происходит с любой связью, имеющей оптимум: доза и польза, температура и урожай, нагрузка и результат. Ноль в этой клетке означает, что прямая данные не описывает, и ничего сверх этого.
Коэффициент измеряет плотность прилегания точек к прямой, а не её наклон. Два исследования с одинаковым коэффициентом 0,9 могут соответствовать приросту в два балла на час подготовки и в двадцать баллов на час. Величина эффекта измеряется в единицах самих величин, а корреляция безразмерна и по построению не может о ней сообщать. Смешение силы связи с величиной эффекта повторяет ту же ошибку, что смешение надёжности с важностью из первого урока.
Термины
- коэффициент корреляцииcorrelation coefficient
- Среднее произведение стандартизованных значений двух величин. Лежит между −1 и 1, безразмерен, измеряет только линейную согласованность.
- ковариацияcovariance
- Среднее произведение отклонений от средних без деления на стандартные отклонения. Зависит от единиц измерения и потому нечитаема напрямую.
- стандартные единицыstandard units
- Значение, переведённое в число стандартных отклонений от среднего. В них корреляция и вычисляется.
- линейная связьlinear association
- Согласованность, которую можно описать прямой. Единственный вид связи, который улавливает коэффициент корреляции.
- диаграмма рассеянияscatter plot
- График пар наблюдений на плоскости. Показывает форму связи, скопления и выбросы, то есть всё, что коэффициент теряет.
- выбросoutlier
- Наблюдение, далеко отстоящее от остальных. В корреляции входит с весом, пропорциональным своему отклонению, и одно способно изменить знак результата.
- ограничение размахаrange restriction
- Сужение диапазона одной из величин в выборке. Снижает корреляцию, не меняя самой связи. Типично для выборок, отобранных по этой же величине.
- ранговая корреляция СпирменаSpearman rank correlation
- Коэффициент, посчитанный не по значениям, а по их порядковым номерам. Улавливает любую монотонную связь и устойчив к выбросам.
Практикум · Что держит этот коэффициент
Задача в том, чтобы увидеть своими руками, насколько корреляция подвижна. Нужны двенадцать и более пар чисел, желательно своих: расходы и день недели, шаги и сон, время задачи и её оценка, цена и площадь квартир из объявлений.
- Соберите не меньше двенадцати пар значений двух величин и запишите их в два столбца. Постройте от руки диаграмму рассеяния: точки на плоскости, ничего больше.
- Посчитайте коэффициент корреляции: переведите оба столбца в отклонения от средних, перемножьте по строкам, возьмите среднее произведений и разделите на произведение стандартных отклонений.
- Найдите на графике самую далёкую от общего облака точку, удалите её и пересчитайте коэффициент. Запишите оба числа рядом и разницу между ними.
- Оставьте только те наблюдения, у которых первая величина попадает в среднюю половину своего диапазона, и посчитайте коэффициент в третий раз. Сравните с исходным. Это цена ограничения размаха на ваших данных.
- Напишите три предложения: какое из пяти объяснений связи здесь наиболее правдоподобно, какое исключено порядком измерений и какие данные потребовались бы, чтобы различить два оставшихся.
Вопросы для самопроверки
Для набора пар, где вторая величина равна квадрату первой, коэффициент корреляции равен нулю. Что из этого следует?
- Что линейной связи нет, а связь при этом полная
- Что данных слишком мало для вывода
- Что величины независимы
- Что в расчёте ошибка: при жёсткой зависимости коэффициент не бывает нулевым
Корреляция роста и веса в выборке равна 0,7. Рост перевели из сантиметров в дюймы, вес из килограммов в фунты. Что стало с коэффициентом?
- Сказать нельзя без исходных данных
- Остался 0,7
- Изменился пропорционально коэффициентам пересчёта
- Стал ближе к нулю, потому что числа уменьшились
В отчёте: корреляция между расходами на рекламу и выручкой по 20 наблюдениям равна 0,85. На диаграмме рассеяния 19 точек образуют бесформенное облако, двадцатая далеко в стороне. Как читать результат?
- Связь сильная и подтверждена: значение 0,85 высокое
- Двадцатую точку надо удалить как ошибку и сообщить итоговый коэффициент: наблюдение, лежащее далеко от облака, по определению является выбросом
- Коэффициент описывает одно наблюдение, а не связь, и нужен пересчёт без него
- Данные надо отбросить целиком: при одной влиятельной точке из двадцати выборка непригодна для любого расчёта
Среди принятых на программу связь вступительного балла с успеваемостью равна 0,2. Что отсюда следует о полезности вступительного теста?
- Почти ничего: выборка отобрана по этому же баллу, и размах сужен
- Вывод корректен, если принятых достаточно много
- Тест бесполезен: связь практически отсутствует
- Тест полезен, но эффект мал
Найдена устойчивая корреляция между потреблением кофе и бессонницей. Какой ход правильный?
- Заключить, что корреляция не означает причинности, и на этом остановиться
- Посчитать коэффициент по большей выборке: при росте объёма вопрос о причине решится
- Перебрать пять возможных объяснений связи и назвать, какие данные их различили бы
- Считать причинную связь установленной, раз корреляция устойчива
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», глава 15: Корреляция и предсказание в стандартных единицах, с примерами нелинейных зависимостей и влияния отдельных точек.
- MIT 18.05, конспект занятия 7: Ковариация и корреляция строго, через совместное распределение. Читается после урока, если нужна формальная сторона.