Фонтумоткрытая школа

университетский уровень · Уровень бакалавриата

Статистика

Что означает «показано» — и где вывод из данных ломается

24урока
8модулей
8тренажёров
150вопросов

Про что курс

Вводные курсы статистики обычно устроены как набор процедур: вот критерий для этого случая, вот таблица с порогами. Процедуры запоминаются, а понимание того, на какой вопрос они отвечают, — нет. Отсюда все типовые ошибки: p-значение принимают за вероятность гипотезы, доверительный интервал — за вероятностное утверждение о конкретном числе, статистическую значимость — за важность.

Здесь порядок обратный: сначала вопрос, потом техника. И почти всё, что в университетском курсе доказывается, показывается симуляцией — так устроен Berkeley Data 8, и для самостоятельного обучения это работает лучше. Матанализ, который MIT указывает пререквизитом, не нужен.

Два последних модуля — то, чего нет ни в одном из курсов-источников: заявление Американской статистической ассоциации о p-значениях, спор об отказе от порога значимости, публикационное искажение и результаты больших проектов по воспроизводимости. Это единственный курс серии, где предмет — сама процедура вынесения суждений о доказательствах.

Что внутри

24 урокавосемь модулей, без пререквизита по матанализу
8 тренажёровсто интервалов подряд, бутстрап на своих числах, мощность и завышение оценок, двадцать проверок на данных без эффекта, разворот Симпсона
Реестр заблужденийместа, где расхожая формулировка расходится с тем, что процедура означает
Причинный выводпо первой части «Causal Inference: What If» Эрнана и Робинса
4 экзаменатри по блокам плюс итоговый — на интерпретацию, а не на счёт
3 письменные работыразбор исследования, пересчёт сообщения в медиа, свой план с предрегистрацией

Кому подойдёт

Тем, кто читает исследования, отчёты и новости с числами и хочет понимать, когда выводу можно верить. Матанализ не требуется.

Программа

8 модулей, 24 урока. Порядок неслучаен: ранние уроки используются в поздних.

  • Модуль I Данные и неопределённость

    1. Что статистика обещает и чего не обещает
    2. Откуда берутся данные и кого в них нет
    3. Центр, разброс и форма
  • Модуль II Случайность

    1. Вероятность: частота, а не ощущение
    2. Условная вероятность и теорема Байеса
    3. Закон больших чисел и центральная предельная теорема
  • Модуль III Вывод по выборке

    1. Выборочное распределение: почему оценка гуляет
    2. Доверительный интервал и что он на самом деле значит
    3. Бутстрап: вывод без формул
  • Модуль IV Проверка гипотез

    1. Логика нулевой модели
    2. Что p-значение не значит
    3. Ошибки, мощность и размер эффекта
    4. Множественные сравнения и сад расходящихся троп
  • Модуль V Связь и причина

    1. Корреляция: что она измеряет и чего не видит
    2. Регрессия и возвращение к среднему
    3. Смешивающие факторы и парадокс Симпсона
    4. Как устанавливают причину
  • Модуль VI Байесовский взгляд

    1. Обновление: априор, свидетельство, апостериор
    2. Два подхода: что отвечает каждый
  • Модуль VII Где статистика ломается

    1. Публикационное искажение
    2. p-хакинг и исследовательские степени свободы
    3. Кризис воспроизводимости: что показали проекты
  • Модуль VIII Что с этим делать

    1. Как читать работу с числами
    2. Что изменилось и что делать самому
Сообщить об ошибке