Размер выборки в исследовании мозга
Пятьдесят тысяч участников понадобилось, чтобы показать: двух десятков не хватает
Исследования связей мозга и поведения требуют тысяч участников. При выборке в двадцать пять человек порог значимости проходит корреляция примерно от 0,40, а Марек и коллеги (Nature, 2022) показали, что медианный воспроизводимый размер эффекта здесь порядка 0,01, и даже в тщательно очищенной подвыборке верхний процент эффектов едва превышает 0,06. Расхождение более чем на порядок означает и завышение опубликованного, и пропуск настоящего.
MIT 9.13 · Marek и др., Nature 603, 654-660, 2022 · курс статистики, уроки 12 и 21 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Считать, какая наименьшая корреляция проходит порог значимости при заданном числе участников
- Объяснять, почему недостаточная мощность одновременно завышает найденное и скрывает настоящее
- Отличать связь между людьми от сравнения условий внутри человека и называть разные требования к выборке
- Разбирать заголовок «нашли область, отвечающую за черту характера» по двум независимым основаниям
Обычное исследование выглядит так. Двадцать пять человек проходят томограф и заполняют опросник. По каждому считается какая-нибудь мера работы мозга. Дальше считается корреляция этой меры с баллом опросника. Получилось 0,5, и заголовок готов: найдена мозговая основа такой-то черты.
Вопрос, который стоит задать раньше всех остальных, звучит скучно: а какой наименьшей должна быть корреляция на выборке в двадцать пять человек, чтобы её вообще объявили значимой? Ответ берётся из таблицы, не зависит ни от предмета, ни от прибора и равен примерно 0,40. Всё, что слабее, порог не перейдёт и напечатано не будет.
Значит, из такого исследования в литературу может попасть только связь силой от 0,4 и выше, независимо от того, какова связь на самом деле. Это не подозрение в чей-либо адрес, а свойство процедуры. Курс статистики этой же школы разбирает его под именем проклятия победителя. Урок посвящён тому, что вышло, когда это свойство измерили на нейровизуализации напрямую.
Пятьдесят тысяч человек, чтобы измерить одно
В 2022 году Скотт Марек, Бренден Терво-Клемменс, Томас Николс, Нико Дозенбах и коллеги опубликовали в Nature работу, у которой вывод стоит прямо в заглавии. Заглавие такое: воспроизводимые исследования связей мозга и поведения требуют тысяч участников.
Предмет назван точно, и от точности здесь зависит всё. Речь о BWAS, то есть brain-wide association studies, исследованиях связи между межиндивидуальными различиями в строении или работе мозга и сложными признаками: результатами когнитивных тестов, показателями психического здоровья. Не о том, чем занята область у одного человека, а о том, чем разные люди отличаются друг от друга.
Замысел работы прост до наглядности. Взять три крупнейших доступных набора данных, суммарно около 50 000 участников. И посмотреть, как ведут себя оценки связи, если из этой массы многократно набирать подвыборки разного объёма: двадцать пять человек, сто, тысяча, три тысячи. На маленькой подвыборке мы оказываемся ровно в положении обычного исследования. На большой мы примерно знаем правильный ответ. Остаётся сравнить одно с другим.
Обратите внимание на устройство проверки: оно то же, что в предыдущем уроке. Чтобы проверить процедуру, нужен материал, где правильный ответ известен заранее. Там его давали записи покоя, в которых задачи не было по построению. Здесь его даёт объединённая выборка, достаточно большая, чтобы оценка на ней перестала гулять от подвыборки к подвыборке. Ни в том, ни в другом случае проверяют не прибор, а способ делать вывод.
Отдельно авторы называют медианный объём выборки в нейровизуализационном исследовании: около 25 человек. Величина эта складывалась под другую задачу, под классическое картирование мозга, где эффекты крупные, и досталась исследованиям связей по инерции, вместе с привычкой считать её достаточной.
Что получилось
Первый результат: связи оказались меньше, чем считалось прежде. Медианный воспроизводимый размер эффекта составляет порядка 0,01 по корреляции. В тщательно очищенной подвыборке верхний процент эффектов едва превышает 0,06.
Сопоставьте это с порогом из начала урока. При двадцати пяти участниках значимой становится корреляция примерно от 0,40, а настоящая величина лежит в сотых долях. Расхождение не в разы, а более чем на порядок. Отсюда следуют сразу две вещи, и обе плохие.
Настоящие связи не находятся. Мощность такого исследования против эффекта величиной 0,01 практически нулевая: почти всякий честно проведённый опыт вернёт «связи не обнаружено», и отрицательный результат ничего не будет означать.
Найденные связи завышены. Порог 0,40 преодолевают только те подвыборки, где корреляция вышла случайно крупной. Опубликованная величина при этом не немного больше настоящей, а больше её в десятки раз, и последующая репликация закономерно «не подтверждает» результат, хотя ничего необычного не происходит. Это ровно то, что курс статистики выводит как проклятие победителя, только здесь оно не выведено, а измерено.
Дальше авторы показывают, как это лечится объёмом: с ростом подвыборок до тысяч доля успешных репликаций растёт, а завышение падает. Арифметика та же самая. При тысяче участников порог значимости опускается примерно до 0,06, а при трёх тысячах примерно до 0,04, и найденное начинает походить на настоящее.
Есть и различия по типу данных, полезные при чтении. Устойчивее оказались эффекты для функциональной МРТ, чем для структурной. Устойчивее для когнитивных тестов, чем для опросников психического здоровья. И устойчивее для многомерного подхода, где признак предсказывается по совокупности показателей всего мозга сразу, чем для подсчёта по одному участку.
Стоит заметить и то, что беды предыдущего урока и этого складываются, а не заменяют друг друга. Отбор вокселей по силе связи завышает оценку сам по себе. Недостаточная мощность завышает то, что прошло порог. А сам порог, взятый из процедуры, которая держит частоту ошибок хуже заявленной, пропускает лишнее. Возьмите работу начала двухтысячных на двух десятках участников, с кластерным выводом при мягком пороге и областью, выбранной по тому же контрасту, из которого потом взята величина. Она собирает все три механизма разом и выглядит при этом совершенно обычно.
Про завышение находок говорят чаще, но вторая половина беды не легче. При мощности, близкой к нулю, фраза «связи не обнаружено» одинаково совместима с отсутствием связи и с неспособностью её увидеть. Поэтому маленькое исследование не даёт ни положительного знания, ни отрицательного: оно поставляет в литературу шум в обе стороны.
Чего этот вывод не означает
Здесь легко перегнуть, и ограничитель авторы ставят сами, прямо в аннотации. Есть подходы вне BWAS, дающие бо́льшие эффекты: поражения, вмешательства и внутрииндивидуальные сравнения. В отличие от них воспроизводимость BWAS требует выборок в тысячи человек.
Разберём, почему это не оговорка из вежливости. Сравните две задачи. Первая: отличается ли отклик области на лица от отклика на предметы у этого человека. Здесь каждый испытуемый даёт собственное сравнение, разброс между людьми в оценку не входит, а различие велико. Именно поэтому область лиц была найдена на пятнадцати обследованных, а результат воспроизводится с тех пор постоянно. Вторая задача: связан ли размер этого различия у разных людей с их баллом по шкале общительности. Тут единицей наблюдения становится человек, а не проба, и искомая величина мала.
Один и тот же прибор, одни и те же записи, а требования к числу участников совершенно разные. Поэтому вывод «нейровизуализации на двух десятках человек верить нельзя» неверен как общее правило: он верен ровно для того класса задач, который проверяли. Восемнадцатый урок разбирает этот класс со стороны содержания, там речь о том, что вообще значат индивидуальные различия в мозге. Здесь нас занимает только цена вопроса в участниках.
Спор о границах класса идёт и сейчас, и его стоит знать. Тамаш Спишак, Ульрике Бингель и Тор Уэйгер (Nature, 2023) показали, что многомерные модели при аккуратной перекрёстной проверке в отдельных случаях воспроизводимы и при выборках порядка сотен. Авторы исходной работы ответили в том же томе. Моника Розенберг и Эмили Финн (Nature Neuroscience, 2022), а также Катерина Граттон с коллегами (Neuron, 2022) указывают на другой путь. По их доводу, величину эффекта можно поднимать устройством исследования: дольше сканировать каждого человека, надёжнее мерить поведение, строить внутрииндивидуальные планы. Общее у этих возражений одно: арифметику никто не оспаривает, ищут, что поставить на место объёма выборки.
Как читать заголовок «нашли область, отвечающую за черту характера»
Соберём практический итог. Такой заголовок содержит два независимых утверждения, и проверять их надо порознь, потому что провал любого хоронит вывод целиком.
Первое касается величины. Спросите объём выборки. Если это десятки человек, брать из работы величину связи нельзя: она либо не найдена вовсе, либо завышена по построению. Полезно посчитать самому: разделите единицу на корень из числа участников без трёх, и получится примерная стандартная ошибка оценки корреляции. При двадцати пяти участниках это около 0,21. Иначе говоря, оценка гуляет от выборки к выборке шире, чем сама измеряемая величина, и сообщать её с двумя знаками после запятой это вежливая форма выдумки.
Второе касается смысла. Оборот «область, отвечающая за» это обратный вывод из предыдущего урока, и он требует отдельного обоснования, даже если выборка безупречна. Связь между межиндивидуальным различием в мозге и баллом опросника, будь она хоть трижды воспроизведена на тысячах, не говорит, что область за черту отвечает. Она говорит, что две измеренные величины меняются согласованно.
Дальше три быстрых вопроса. О какой связи речь, между людьми или между условиями внутри человека? Проверялась ли находка на данных, которые не участвовали в её получении? Какого года работа и не относится ли она к периоду, когда выборка в двадцать пять человек считалась нормой?
И последнее, ради чего этот урок стоит в модуле о проверке инструмента. Слабое исследование связей мозга и поведения не «предварительное свидетельство», которое потом уточнят. Это измерение, ожидаемая ошибка которого больше измеряемой величины. Складывать такие измерения в общую картину нельзя, потому что десять слабых работ дают не одну сильную, а смещённую литературу. И чинится это не аккуратностью авторов, а объёмом, устройством исследования и проверкой на данных, которых модель не видела.
Стандартная ошибка корреляции равна примерно единице, делённой на корень из числа участников без трёх. Для 25 человек это 0,21, для 100 около 0,10, для 1000 около 0,03. Порог значимости лежит примерно на двух таких ошибках. Три деления в уме позволяют сказать, какую наименьшую связь эта работа вообще могла объявить найденной, и часто этого достаточно, чтобы закрыть вопрос.
Разброс на малой выборке
Истинная связь между показателем мозга и чертой поведения задана вами и одинакова во всех исследованиях. Меняйте объём выборки и смотрите, что получают отдельные исследователи.
Ключевые работы
| Scott Marek, Brenden Tervo-Clemmens, Thomas Nichols, Nico Dosenbach и коллеги, «Reproducible brain-wide association studies require thousands of individuals», Nature 603, 654-660 | 2022 | Три крупнейших набора данных, суммарно около 50 000 участников. Связи мозг-поведение меньше, чем считалось. При типичной выборке около 25 человек исследования недостаточно мощны, размеры эффекта завышены, репликации проваливаются. С ростом выборки до тысяч воспроизводимость растёт, завышение падает. |
| Tamas Spisak, Ulrike Bingel, Tor Wager, «Multivariate BWAS can be replicable with moderate sample sizes», Nature 615, E4-E7 | 2023 | Возражение: при аккуратной перекрёстной проверке многомерные модели бывают воспроизводимы и при выборках порядка сотен, если истинная связь достаточно велика, а данные качественны. |
| Marek и коллеги, «Reply to: Multivariate BWAS can be replicable with moderate sample sizes», Nature 615, E8-E12 | 2023 | Ответ авторов исходной работы в том же томе. Спор о многомерных методах открыт. Вывод о недостаточности выборок в пару десятков человек он не отменяет. |
| Monica Rosenberg, Emily Finn, «How to establish robust brain-behavior relationships without thousands of individuals», Nature Neuroscience 25(7), 835-837 | 2022 | Другой путь к устойчивым связям: поднимать величину эффекта устройством исследования, то есть больше времени сканирования на человека, надёжнее поведенческие меры, внутрииндивидуальные планы. |
| Caterina Gratton, Steven Nelson, Evan Gordon, «Brain-behavior correlations: two paths toward reliability», Neuron 110(9), 1446-1449 | 2022 | Два пути к надёжности: наращивать число участников или наращивать количество данных на одного участника. Выбор зависит от того, какого рода связь ищут. |
Что подтвердилось, а что нет
Марек и коллеги (2022) на объединённых наборах общим объёмом около 50 000 участников показали: при типичном объёме такие исследования статистически недостаточно мощны, дают завышенные размеры эффекта и проваливают репликацию. Арифметика проста и проверяется в уме: при двадцати пяти участниках значимой становится корреляция примерно от 0,40, тогда как медианный воспроизводимый эффект в этой области держится порядка 0,01. Всё, что из такой работы печатается, завышено по построению. А всё, что не печатается, и есть реальные слабые связи, которые она не могла заметить.
Держится под давлением, и держится не как предположение, а как измерение: с ростом подвыборок доля успешных репликаций растёт, а завышение падает. Возражения касаются не арифметики, а границ применимости. Спишак, Бингель и Уэйгер (2023) показали, что многомерные модели при аккуратной перекрёстной проверке бывают воспроизводимы и при сотнях участников. Авторы исходной работы ответили в том же томе. Розенберг и Финн (2022), Граттон с коллегами (2022) предлагают поднимать величину эффекта устройством исследования. Ни одна из этих линий не возвращает в оборот выборку в двадцать пять человек.
Ограничитель стоит в самой аннотации работы: требование тысяч относится к связям между межиндивидуальными различиями и сложными признаками, а подходы с бо́льшими эффектами, такие как поражения, вмешательства, внутрииндивидуальные сравнения, под него не подпадают. Разница в устройстве вопроса. Когда каждый испытуемый даёт собственное сравнение двух условий, разброс между людьми в оценку не входит и различие оказывается крупным. Именно поэтому избирательность области лиц установлена на полутора десятках обследованных и воспроизведена многократно, а корреляция того же различия с чертой личности требует тысяч.
Термины
- исследование связей мозга с поведениемbrain-wide association study
- Поиск корреляций между показателями мозга и показателями поведения по выборке людей. Для воспроизводимости требует тысяч участников.
- внутрииндивидуальный эффектwithin-person effect
- Различие между условиями, измеренное внутри одного и того же человека. Разброс между людьми в такую оценку не входит, поэтому эффект крупнее и требует меньших выборок, чем связь между людьми.
- мощностьstatistical power
- Вероятность обнаружить эффект заданной величины при условии, что он существует. Равна единице минус вероятность ошибки второго рода. Низкая мощность делает незначимость неинформативной, а значимость завышенной.
- проклятие победителяwinner's curse
- Завышение оценок, прошедших отбор: при малой мощности порога значимости достигают лишь те выборки, где разница вышла случайно крупной, поэтому опубликованная величина систематически выше истинной.
- воспроизводимость находкиreplication rate
- Доля находок, подтверждающихся на независимой выборке. В исследованиях связей мозга и поведения растёт с объёмом выборки и при типичных объёмах мала.
- многомерный подходmultivariate approach
- Предсказание поведения по совокупности показателей всего мозга сразу, а не по одному участку. Собирает слабый сигнал и потому требует меньших выборок, чем поточечный анализ.
- перекрёстная проверкаcross-validation
- Оценка предсказательной силы модели на тех наблюдениях, которые не участвовали в её подгонке. Без неё заявленная точность завышена по построению.
Практикум · Разброс оценки на выборках разного объёма
Первая половина проходит на тренажёре «Сколько нужно людей», где связь известной силы измеряется на подвыборках разного объёма. Вторая идёт на живой работе. Понадобится калькулятор и одна статья или новость со связью мозг-поведение. 30-45 минут.
- Откройте тренажёр и задайте истинную связь равной 0,05. Наберите подвыборку в 25 человек пять раз подряд и запишите пять полученных оценок. Отметьте, какие из них перешли бы порог значимости и насколько они больше истинной величины.
- Не меняя истинной связи, повторите то же при 100, 1000 и 3000 участниках. Для каждого объёма запишите размах оценок и долю перешедших порог.
- Посчитайте на бумаге примерную стандартную ошибку для каждого объёма, то есть единицу, делённую на корень из числа участников без трёх, и сравните с размахом, который дал тренажёр. Убедитесь, что порог значимости лежит примерно на двух таких ошибках.
- Возьмите статью или новость со связью между мозгом и поведением. Выпишите объём выборки, сообщённую величину связи и то, проверялась ли находка на данных, не участвовавших в её получении.
- Напишите три строки. Какую наименьшую связь эта работа вообще могла объявить найденной. Во сколько раз сообщённая величина превышает медианный воспроизводимый эффект в этой области. И что нужно было бы добавить, участников или другое устройство исследования, чтобы вывод стал переносимым.
Вопросы для самопроверки
Исследование на 25 участниках сообщает корреляцию 0,45 между мерой работы мозга и баллом опросника. Известно, что медианный воспроизводимый эффект такого рода составляет порядка 0,01. Что вероятнее всего произошло?
- Найдена необычно сильная связь: раз она преодолела порог значимости на малой выборке, на большой она окажется ещё крупнее
- Опросник измеряет то же самое, что и мера работы мозга, оттого связь и велика
- Авторы ошиблись в расчёте корреляции: при таком объёме такое число не получается
- Порог значимости при 25 участниках лежит около 0,40, и преодолевают его только случайно завышенные оценки
Почему избирательность области лиц удалось установить на пятнадцати обследованных, а связь той же области с чертой личности требует тысяч участников?
- Потому что лица служат более простым стимулом, чем черта личности, и отклик на них крупнее и устойчивее у любого человека, а простой стимул требует меньше данных
- Потому что в первом случае сравниваются условия внутри одного человека, а во втором единицей наблюдения становится человек и искомая величина мала
- Потому что раньше требования к выборкам были ниже, а теперь их подняли для всех работ без разбора, и старые результаты приходится пересматривать целиком
- Потому что структурные измерения надёжнее функциональных и требуют меньше участников для той же точности оценки, а речь во втором случае идёт как раз о структуре
Группа увеличила выборку с 25 до 2000 человек и получила корреляцию 0,05 вместо прежних 0,45. Как это читать?
- Связь исчезла при проверке, значит, её не было вовсе
- В данных большой выборки что-то испортилось: разнородные наборы смешивать нельзя, от этого оценка и съехала к нулю
- Крупная выборка дала оценку, близкую к настоящей, а прежняя величина была отобрана порогом значимости
- Эффект ослабевает со временем, и повторные измерения дают всё меньшие величины
В работе сообщается, что многомерная модель предсказывает балл когнитивного теста по картине активности мозга. Что важнее всего проверить, прежде чем принимать заявленную точность?
- Считалась ли точность на наблюдениях, которые не участвовали в подгонке модели
- Сколько вокселей вошло в модель и как отбирались признаки
- Каким пакетом обработаны данные и какой его версией
- Была ли сделана поправка на множественные сравнения при отборе признаков в модель
Что именно измеряли Марек и коллеги на объединённых данных примерно 50 000 участников?
- Какие области мозга отвечают за черты личности
- Как величина оценки связи и доля успешных репликаций зависят от объёма выборки
- Насколько устойчив сигнал фМРТ при повторном сканировании одного человека
- Различается ли мозг здоровых людей и людей с психическими расстройствами
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Scott Marek и др., «Reproducible brain-wide association studies require thousands of individuals», Nature, 2022: Читать вместе с последней фразой аннотации: именно там проведена граница между BWAS и подходами с большими эффектами, без которой вывод работы обычно перевирают.
- Tamas Spisak, Ulrike Bingel, Tor Wager, Nature, 2023, и ответ Marek и др. там же: Образцовый научный спор в двух коротких текстах: о чём стороны согласны и где именно расходятся.
- Monica Rosenberg, Emily Finn, Nature Neuroscience, 2022: Что делать, если тысяч участников нет: три страницы о том, как поднимать величину эффекта устройством исследования.