Бутстрап в статистике
Одна выборка, тысяча перевыборок и интервал для чего угодно
Бутстрап это оценка разброса статистики повторным отбором из собственной выборки: из неё многократно извлекают перевыборки того же объёма с возвращением и считают статистику по каждой. Полученное бутстрап-распределение приближает выборочное, а интервал строится отрезанием равных долей с концов: по 2,5 % для 95 %. Приём работает для медианы и других статистик без готовых формул, но не чинит смещение и малую выборку.
MIT 18.05, занятие 24 · Data 8, гл. 13 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Проделывать перевыборку с возвращением и понимать, зачем возвращение обязательно
- Строить процентильный интервал по бутстрап-распределению
- Применять приём к статистикам, для которых простой формулы не существует
- Называть, чего бутстрап не чинит: смещение, малую выборку, крайние статистики
Седьмой и восьмой уроки держались на мысленном эксперименте со ста группами. У него есть изъян, который пора назвать: ста групп не бывает. Есть одна выборка, а выборочное распределение остаётся ровно тем, чего исследователь никогда не видит.
Для среднего выкрутиться удалось: разброс оценки считается по формуле, куда подставляется разброс, посчитанный по своей же выборке. А для медианы? Для отношения двух средних? Для разницы между девяностым и десятым процентилем? Формулы здесь либо громоздки, либо не существуют вовсе, а вопрос «насколько это число могло бы оказаться другим» никуда не делся.
Бутстрап даёт способ обойтись без формул. Идея настолько проста, что при первом знакомстве выглядит как жульничество: раз новых выборок из совокупности взять негде, будем брать новые выборки из своей выборки.
Как это делается: разбор на шести числах
Данные. Время ожидания приёма у шести пациентов в минутах: 4, 6, 9, 11, 14, 32. Медиана равна половине суммы двух средних значений, то есть 10. Среднее получается 76, делённое на 6, примерно 12,7.
Вопрос: насколько надёжна медиана 10? Другая шестёрка пациентов дала бы другое число, но какое примерно и насколько далёкое?
Процедура. Напишем шесть чисел на шести одинаковых карточках. Вытянем одну, запишем, вернём обратно, перемешаем, и так шесть раз. Получится новая шестёрка того же объёма: перевыборка. Возвращение означает, что какие-то числа попадут дважды, а какие-то не попадут вовсе, и в этом весь механизм. Быстрее выйдет костью: грань показывает номер числа от первого до шестого.
Три перевыборки, полученные бросками кости. Броски 3, 1, 6, 2, 3, 5 дают числа 9, 4, 32, 6, 9, 14. Отсортировав, получаем 4, 6, 9, 9, 14, 32, медиана равна 9. Броски 5, 5, 2, 1, 4, 6 дают 14, 14, 6, 4, 11, 32. После сортировки выходит 4, 6, 11, 14, 14, 32, медиана 12,5. Броски 1, 1, 2, 3, 3, 4 дают 4, 4, 6, 9, 9, 11, медиана 7,5.
Три числа: 9 · 12,5 · 7,5. Медиана гуляет, и мы только что впервые увидели, как именно, не рассуждая о совокупности, а работая с тем, что есть на столе. Повторив тысячу раз на компьютере или двадцать раз на бумаге, получим бутстрап-распределение медианы.
Стоит посмотреть, что случилось с составом. В первой перевыборке нет числа 11, зато девятка попала дважды. Во второй нет девятки, а 14 попало дважды. В третьей отсутствуют сразу два самых больших числа, 14 и 32, потому медиана и провалилась до 7,5. Это не порча данных, а ровно то, что моделируется: другой шестёрке пациентов достались бы другие времена ожидания. Вероятность, что конкретное число не попадёт в перевыборку ни разу, равна пяти шестым в шестой степени, то есть примерно 0,33, так что отсутствие двух чисел из шести обычное дело, а не сбой процедуры.
Дальше всё как в восьмом уроке. Отсортировать тысячу медиан, отрезать 25 самых маленьких и 25 самых больших, объявить оставшийся промежуток 95-процентным интервалом. Формула не понадобилась ни разу, понадобилась только способность посчитать медиану.
Честная оговорка про этот пример: при шести наблюдениях медиана перевыборки принимает всего несколько разных значений, и интервал получается грубым до бесполезности. Пример учит механике, а не даёт результат. Для работы нужны хотя бы десятки наблюдений.
Первый: взять перевыборку того же объёма, что исходная выборка, с возвращением. Второй: посчитать на ней ровно ту же величину, что считали на данных. Третий: повторить много раз и отрезать хвосты у полученного распределения. Меняется только слово во втором шаге, будь то среднее, медиана, доля, коэффициент корреляции. Остальное не меняется никогда.
Почему это работает
Объяснение укладывается в одну пропорцию: перевыборка относится к выборке так же, как выборка к совокупности.
Развернём. Единственное, что известно о совокупности, это выборка. Значит, лучшая доступная модель совокупности и есть сама выборка, как если бы город целиком состоял из повторений наших шести пациентов в равных долях. Взять шесть наблюдений из такой модели всё равно что вытянуть шесть карточек с возвращением. Мы не знаем, насколько выборка гуляет вокруг совокупности, но можем измерить, насколько перевыборки гуляют вокруг выборки, и перенести эту величину на первое.
У приёма есть имя: принцип подстановки. Неизвестное распределение заменяется эмпирическим, и дальше всё считается, как если бы подстановка была точной.
Законность подстановки держится на законе больших чисел из шестого урока: чем больше выборка, тем ближе эмпирическое распределение к настоящему. Отсюда и границы применимости. Обоснование у бутстрапа асимптотическое, он тем вернее, чем больше наблюдений, и никакой гарантии для шести чисел не даёт.
Проверить, что метод не жульничает, можно на задаче, где ответ известен заранее. Возьмём выборку из ста времён поездки из седьмого урока с выборочным разбросом 19,4. Формула даёт стандартную ошибку 1,94. Бутстрап делает тысячу перевыборок по сто наблюдений, берёт тысячу средних и их стандартное отклонение, и выдаёт практически то же число. Расхождение будет в сотых и вызвано только конечным числом повторений. Совпадение там, где формула есть, и есть основание доверять методу там, где её нет.
Отдельно про возвращение, потому что это место, где ошибаются чаще всего. Если тянуть карточки без возвращения, перевыборка из шести карточек окажется теми же шестью числами в другом порядке. Медиана у неё всегда 10, разброс нулевой, и никакого распределения не получится. Возвращение не техническая мелочь, а весь механизм: именно оно воспроизводит то обстоятельство, что в другую выборку попали бы другие люди.
Чего бутстрап не чинит
Метод, который работает почти всегда, соблазняет считать, что он работает всегда. Четыре места, где он не помогает, стоит держать наизусть.
Смещение. Пусть шесть времён ожидания записаны у тех, кто дождался приёма, а ушедшие из очереди в данные не попали, это ошибка выжившего из второго урока. Бутстрап аккуратно воспроизведёт разброс оценки для дождавшихся и выдаст узкий интервал вокруг неверного числа. Он знает ровно те данные, которые ему дали, и ничего о том, как они появились. Правило: бутстрап оценивает случайную ошибку и наследует систематическую целиком.
Малую выборку. Тысяча перевыборок из шести чисел не содержит ничего, чего нет в шести числах. В любой перевыборке встречаются только 4, 6, 9, 11, 14 и 32. Если в городе бывает ожидание в 90 минут, а нам оно не попалось, ни одна перевыборка его не изобретёт. Ощущение объёма, «у меня тысяча значений», обманчиво: информации по-прежнему на шесть наблюдений.
Крайние статистики. Проверьте на наших числах: максимум перевыборки не может превзойти 32, потому что тянуть больше неоткуда. Бутстрап-распределение максимума прижато к 32 и уходит только вниз, тогда как настоящее выборочное распределение максимума лежит и выше. Интервал для максимума, построенный так, заведомо неверен, и это видно на бумаге за минуту. То же с минимумом и с крайними процентилями. Общее правило: чем сильнее статистика зависит от одного-двух наблюдений, тем хуже работает бутстрап.
Зависимые наблюдения. Перевыборка предполагает, что наблюдения независимы и равноправны. Для временного ряда, для повторных измерений одного человека, для учеников внутри классов это неверно: простая перевыборка разрушает структуру и даёт слишком узкий интервал. Версии метода для таких данных существуют, но простую применять нельзя.
Если бутстрап дал подозрительно узкий промежуток, спросите, откуда взялась точность. Иногда ответ честный: наблюдений много. Чаще ответ один из трёх: перевыборка сломала зависимость в данных, выбросы были отброшены до перевыборок, а не внутри каждой, или интервал отвечает на вопрос о смещённой совокупности, к которой у нас есть доступ, а не о той, которая интересна.
Где бутстрап незаменим
Перечень задач, ради которых метод и появился, это всё, для чего простой формулы нет.
Медиана и любые процентили. Отношение двух величин: средняя выручка на клиента, доля от доли, коэффициент конверсии. Разность девяностого и десятого процентиля, распространённая мера неравенства. Коэффициент корреляции, о котором пойдёт речь в четырнадцатом уроке. Наконец, результат многошаговой обработки: отсортировали, отбросили две крайние точки, поделили одно на другое, взяли логарифм. Для такой величины формулы разброса не существует в принципе, а бутстрап работает с ней ровно так же, как со средним.
Числовой пример на отношении. Пусть из сорока посетителей магазина покупку сделали десять, а средний чек покупателя оказался 1200 рублей. Выручка на посетителя это десять разделить на сорок и умножить на 1200, то есть 300 рублей. Величина зависит сразу от двух случайных вещей: сколько человек купили и на какую сумму. Формулы для разброса такого произведения нет, а бутстрап поступает с ним так же, как со средним: перевыбрать сорок посетителей с возвращением, пересчитать на каждой перевыборке оба множителя заново, повторить тысячу раз, отрезать хвосты. Слово «оба» здесь ключевое: если долю покупателей зафиксировать и перевыбирать только чеки, часть изменчивости исчезнет и интервал получится уже настоящего.
Отсюда рабочее правило: любой расчёт, который вы умеете выполнить на выборке, вы умеете и обутстрапить. Повторите весь расчёт целиком на каждой перевыборке. Слово «целиком» здесь несёт нагрузку: если отбрасывание выбросов или выбор модели выполнены один раз до перевыборок, интервал получится уже настоящего, потому что часть изменчивости окажется зафиксированной и невидимой.
Число повторений остаётся единственным параметром, который выбирает исследователь, и стоит он только машинного времени. Тысяча служит рабочим минимумом для интервала, а десять тысяч нужны, если интересуют крайние процентили. Важно понимать, что именно покупается: увеличение числа перевыборок уменьшает шум самого метода, но не сужает интервал. Ширина определяется данными, а не усердием. Если, добавив повторений, вы заметно изменили результат, значит повторений было мало.
Именно поэтому бутстрап служит главным инструментом курса без матанализа. Техника одна на все задачи, объясняется за пять минут, проверяется на примере, где ответ известен. Data 8 строит на нём все свои интервалы. MIT 18.05 отводит ему занятие 24, после двух занятий классических интервалов, то есть сначала показывает формулу, а потом способ обойтись без неё.
Что записывать в отчёте
Бутстрап-интервал легко предъявить так, что проверить его будет невозможно. Минимальный набор, который делает результат проверяемым, состоит из пяти пунктов.
Объём выборки. Оцениваемая величина не «показатель», а именно медиана, отношение, разность процентилей. Число перевыборок. Способ построения интервала: процентильный или какой-то ещё, их существует несколько. И главное, как получены сами данные.
Последний пункт важнее четырёх предыдущих вместе, потому что это единственное, чего метод не проверяет и не может проверить. Отчёт, где подробно расписаны десять тысяч перевыборок и ни слова о том, кто попал в выборку, устроен ровно наоборот, чем следует.
И общий итог третьей части курса. Седьмой урок ввёл распределение оценки, которого не видно. Восьмой показал, что с ним делать, и разобрал, что означает приписанное к интервалу «95 %». Девятый дал способ получить это распределение из единственной выборки без формул и допущений о форме. Дальше, в четвёртой части, тем же приёмом симуляции решается вторая большая задача: не «какова величина», а «могло ли наблюдаемое различие возникнуть само по себе».
Бутстрап своими руками
Одна выборка из двенадцати наблюдений, и никаких формул. Перевыбираем её саму из себя тысячу раз и смотрим, как гуляет медиана.
Ключевые работы
| Adhikari, DeNero, Wagner, «Computational and Inferential Thinking» | 2022 | Глава 13, оценивание в Data 8: доверительные интервалы строятся бутстрапом, формула с квантилями не вводится вовсе. |
| Orloff, Kamrin, MIT 18.05 «Introduction to Probability and Statistics» | 2022 | Занятие 24: бутстрап-интервалы даются после двух занятий классических интервалов, как способ получить тот же ответ там, где формулы нет. |
Что здесь путают
Перевыборки не добавляют информации, потому что берутся из того же самого набора чисел. В любой перевыборке наших шести пациентов встречаются только 4, 6, 9, 11, 14 и 32. Значения, которых в выборке нет, не появятся ни при каком числе повторений. Число перевыборок управляет только шумом самого метода: с тысячи до десяти тысяч интервал станет устойчивее, но не уже. Ширину интервала определяет объём выборки, и увеличить её перевыборками нельзя, и это то же самое обещание бесплатной точности, что и «большая выборка лечит смещение».
Он действительно не требует допущения о форме распределения, и в этом его сила по сравнению с формулами, выведенными для нормального случая. Но два допущения остаются, и они сильнее. Первое: наблюдения независимы и равноправны. Для временных рядов и повторных измерений одного человека это неверно, и простая перевыборка даёт слишком узкий интервал. Второе: выборка получена из той совокупности, о которой идёт речь. Если она смещена, бутстрап воспроизведёт смещение в точности и оформит его аккуратным узким промежутком. Свобода от допущений о форме ещё не свобода от допущений вообще.
Для среднего при не слишком малой выборке процентильный бутстрап-интервал и классический интервал совпадают с точностью до нескольких сотых, и расхождение объясняется конечным числом повторений. Это и есть основание доверять методу там, где формулы нет: он проверяется на задачах с известным ответом и их воспроизводит. Оговорка при этом остаётся: совпадение перестаёт быть надёжным при очень малых выборках и для статистик, зависящих от крайних наблюдений. Там расходятся не только цифры, но и сам подход.
Термины
- бутстрапbootstrap
- Оценка разброса статистики повторным отбором из собственной выборки. Название отсылает к обороту «вытащить себя за шнурки от ботинок».
- перевыборкаresample
- Набор того же объёма, что исходная выборка, полученный из неё отбором с возвращением.
- отбор с возвращениемsampling with replacement
- Способ отбора, при котором вытянутое значение возвращается назад и может быть вытянуто снова. Без него перевыборка совпадает с выборкой.
- бутстрап-распределениеbootstrap distribution
- Распределение значений статистики по всем построенным перевыборкам. Приближает выборочное распределение.
- процентильный интервалpercentile interval
- Интервал, полученный отрезанием равных долей с концов бутстрап-распределения: для 95 % отрезают по 2,5 % с каждой стороны.
- принцип подстановкиplug-in principle
- Замена неизвестного распределения совокупности эмпирическим распределением выборки. Обоснование бутстрапа в одну строку.
- непараметрический методnonparametric method
- Метод, не предполагающий известной формы распределения. Бутстрап остаётся основным из них для задач оценивания.
- шум методаMonte Carlo error
- Расхождение результатов из-за конечного числа повторений симуляции. Убывает с числом перевыборок и не связан с объёмом данных.
Практикум · Бутстрап на кухонном столе
Задача в том, чтобы проделать перевыборку руками, пока она не перестанет выглядеть фокусом. Нужны игральная кость (или шесть одинаковых бумажек), лист и около получаса. Числа можно взять свои: время в пути за шесть дней, шесть последних чеков, шесть длительностей задач.
- Возьмите шесть чисел, свои или учебные 4, 6, 9, 11, 14, 32. Посчитайте медиану (у учебных это 10) и среднее (примерно 12,7). Пронумеруйте числа от 1 до 6 по возрастанию.
- Бросьте кость шесть раз, выпишите соответствующие числа, и это перевыборка. Отсортируйте её и посчитайте медиану. Проверьте себя на готовом примере: броски 3, 1, 6, 2, 3, 5 дают 4, 6, 9, 9, 14, 32 и медиану 9.
- Повторите шаг 2 двадцать раз. Двадцать медиан выпишите в столбик и отсортируйте по возрастанию.
- Отбросьте самое маленькое и самое большое значение. Промежуток от второго до девятнадцатого и есть 90-процентный бутстрап-интервал для медианы. Сравните его ширину с самой медианой и запишите одним предложением, что вы теперь знаете о надёжности числа 10.
- В тех же двадцати перевыборках отметьте максимум каждой. Убедитесь, что ни один не превысил 32, и объясните письменно, почему из этого следует, что интервал для максимума таким способом строить нельзя.
Вопросы для самопроверки
Что такое перевыборка в бутстрапе?
- Новая выборка, взятая из генеральной совокупности
- Набор того же объёма, взятый из исходной выборки с возвращением
- Исходные наблюдения, переставленные в случайном порядке
- Часть исходной выборки, взятая без возвращения
Шесть времён ожидания записаны только у тех, кто дождался приёма, а ушедшие из очереди в данные не попали. Что даст бутстрап?
- Не даст интервала: метод проверяет случайность выборки по разбросу перевыборок и в таком случае сообщает об отказе
- Исправит перекос, если сделать достаточно перевыборок: при десяти тысячах повторений ушедшие из очереди учитываются неявно
- Покажет, что данные смещены, необычно широким интервалом: смещение отбора всегда увеличивает разброс оценки
- Корректный разброс оценки для дождавшихся и неверный ответ на вопрос обо всех пришедших
Исследователь сделал 10 000 перевыборок из 12 наблюдений и говорит, что теперь работает со 120 000 значений и оценка получилась очень точной. Что не так?
- Информации по-прежнему ровно столько, сколько в двенадцати наблюдениях
- Перевыборки нужно было делать большего объёма, чем исходная выборка
- Ничего: объём данных действительно вырос
- Перевыборки нужно было брать без возвращения
Для какой статистики бутстрап работает хуже всего?
- Медиана
- Разность первого и третьего квартиля
- Максимум выборки
- Среднее
Бутстрап-интервал для среднего совпал с интервалом по классической формуле почти до сотых. Что это значит?
- Выборка слишком мала, чтобы различить два метода: на больших объёмах бутстрап и формула расходятся
- Так и должно быть, и это основание доверять методу там, где формулы не существует
- Бутстрап бесполезен: он лишь повторяет то, что даёт формула, и своего результата ни в одной задаче не добавляет
- Одна из двух процедур выполнена с ошибкой: совпадение до сотых у случайного метода и формулы невозможно
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», глава 13: Бутстрап как единственный способ построения интервалов в курсе Berkeley. Там же наглядно видно, что процедура одна и та же для любой статистики.
- MIT 18.05, конспект занятия 24: Бутстрап-интервалы у Орлоффа и Камрин, с эмпирическим и параметрическим вариантами и с оговорками о границах применимости.