К содержанию
Фонтум Мозг и нейронаука Урок 20 / 24 Все уроки

Главная · Курсы · Мозг и нейронаука · Программа курса · Модуль VII. Проверка инструмента · урок 20 из 24

Критика фМРТ: проверка методов

Двойное погружение, кластерный вывод и поправка, которую пришлось внести самой критике

Двойное погружение это отбор данных по некоторому критерию и оценка величины эффекта по тому же критерию на тех же данных. Результат систематически завышается. Вул, Харрис, Винкельман и Пашлер (2009) запросили методические подробности у авторов 55 статей: из 53 ответивших 53 % отбирали воксели по связи с поведенческой мерой и по ним же считали публикуемую величину связи. Надёжность измерений ставит наблюдаемой корреляции потолок около 0,74.

MIT 9.13 · Vul, Harris, Winkielman, Pashler, Perspectives on Psychological Science, 2009 · Eklund, Nichols, Knutsson, PNAS, 2016 · 45 мин · обновлено 01.10.2026

После урока вы сможете

  • Считать потолок, который надёжности двух измерений ставят наблюдаемой корреляции
  • Опознавать двойное погружение по описанию процедуры и называть, чем оно лечится
  • Объяснять, что именно сломалось в кластерном выводе и почему перестановочный тест устоял
  • Различать узкую и широкую версию утверждения «фМРТ недостоверна» и обосновывать разницу
  • Читать историю с поправкой к заявлению о сорока тысячах работ как урок о самой критике

В конце 2008 года по рукам пошёл препринт под названием «Voodoo Correlations in Social Neuroscience», в переводе «Воодуистские корреляции в социальной нейронауке». К публикации в Perspectives on Psychological Science название смягчили до «Puzzlingly High Correlations», «Озадачивающе высокие корреляции», и авторы отметили переименование сноской в первой же строке. Спорить, впрочем, стали не о названии.

Предмет спора выглядел так. В работах о мозге, эмоциях и личности регулярно сообщались корреляции между активностью какого-нибудь участка коры и баллом по личностной шкале порядка 0,8 и выше. Для психологии это невероятно много: связи такой силы там встречаются между двумя измерениями одного и того же свойства, а не между двумя разными вещами.

Эдвард Вул, Кристина Харрис, Пётр Винкельман и Гарольд Пашлер задали не тот вопрос, которого ждали. Не «верны ли эти корреляции», а «какой величины они вообще могут быть». Этот ход стоит запомнить отдельно от результата: прежде чем спорить о числе, полезно выяснить, какие числа тут в принципе возможны.

Потолок, который ставит надёжность

Ответ даёт классическая теория тестов, и он не требует ни новых данных, ни доступа к чужим. Всякое измерение состоит из устойчивой части и шума. Надёжностью измерения называют долю устойчивой части. На практике её оценивают, измерив одно и то же дважды у тех же людей и посчитав корреляцию двух замеров.

Дальше арифметика. Наблюдаемая корреляция двух величин не превосходит истинной связи, умноженной на корень из произведения надёжностей обоих измерений. Смысл прост: шум одного измерения не может согласованно колебаться с шумом другого, поэтому чем больше в измерениях шума, тем слабее выглядит любая настоящая связь.

Подставим числа, которые собрали авторы. Надёжность личностных и эмоциональных шкал: обзор по Большой пятёрке даёт 0,73-0,78. У подшкал MMPI она от 0,66 до 0,94. Авторы называют диапазон 0,7-0,8 оптимистичным для тех небольших шкал, которые обычно применяют в таких работах. Надёжность сигнала фМРТ на уровне отдельного вокселя, по нескольким работам с повторным сканированием, нечасто оказывается выше примерно 0,7.

Отсюда предел: даже если бы связь между настоящей активностью области и настоящей чертой была идеальной, наблюдаемая корреляция не превысила бы корня из произведения 0,8 и 0,7, то есть 0,74. Корреляций выше этого потолка в литературе оказалось много.

Стоит задержаться на том, какого рода это рассуждение. Оно никого не обвиняет и не разбирает ни одной конкретной работы. Оно говорит: заявленные величины несовместимы с тем, что известно о точности самих измерений, а значит, где-то в цепочке есть шаг, о котором в разделе «методы» не написано. Оставалось найти этот шаг.

методПотолок за полминуты

Возьмите надёжность каждой из двух мер, перемножьте, извлеките корень. Получится наибольшая корреляция, какую эти два инструмента могут показать, будь связь между самими свойствами идеальной. Приём работает не только в нейронауке: он одинаково полезен там, где одним измерением служит опросник, а другим прибор.

Отбор и оценка на одних и тех же данных

Авторы написали авторам 55 статей и попросили описать, как именно считалась корреляция. Методические подробности удалось получить по 53 работам. Двое не ответили на повторные запросы.

Ответы объяснили всё. 53 % ответивших сказали: воксели отбирались по «регрессии по испытуемым». То есть в область попадали именно те воксели, где связь с поведенческой мерой оказалась сильной. И по этим же вокселям затем считалась и публиковалась величина связи.

Механизм тут чисто арифметический, и он не требует ни ошибки в расчётах, ни недобросовестности. Вокселей в мозге десятки тысяч. Даже если настоящей связи нет вовсе, у части из них корреляция с личностной шкалой окажется случайно высокой. Отобрав их по этому признаку и посчитав среднее по отобранным, вы получите большое число, и получите его гарантированно, потому что отбирали по нему же.

Сами авторы предлагают такое сравнение: выбрать из тысячи акций те, чьи прошлогодние колебания случайно совпали с показаниями термометра, посчитать среднюю корреляцию по отобранным и объявить, что рынок предсказывается погодой. Число получится внушительным, а вкладывать в него деньги не стоит. Ошибка называется двойным погружением: данные использованы дважды, сначала для отбора, потом для оценки. А отчёт составлен так, будто использованы один раз.

Лечится это разделением данных. Область интереса определяется по одному набору наблюдений, будь то отдельный прогон, отдельная группа или отложенная половина испытуемых, а величина связи считается по другому. Тогда отбор и оценка независимы, и число означает ровно то, что написано. Именно так устроены работы об области лиц из второго модуля: контраст, которым очерчена область, и контрасты, которыми проверяется её избирательность, берутся из разных данных, и авторы отдельно это оговаривают.

Спор вокруг статьи был жёстким, и содержательные возражения у неё есть. Часть их касалась того, насколько широко распространена практика и насколько сильно она завышала. Механизм при этом оспаривать не стал никто: он проверяется симуляцией на данных без всякого эффекта, и любой желающий делает это сам за полчаса. То, что решения об анализе, принятые после взгляда на данные, портят вывод, курс статистики этой же школы разбирает отдельно, под именем исследовательских степеней свободы.

Cluster failure

Вторая работа проверяет другой этап. Речь не о том, как выбирают область, а о том, как решают, что найденное не случайно.

Стандартная процедура называется кластерным выводом. Сначала по каждому вокселю считается статистика различия и берётся порог. Его называют порогом определения кластера. Затем соседние воксели, перешедшие порог, объединяются в связные пятна, и вопрос ставится о пятне целиком: насколько вероятно получить кластер такого размера, если никакого эффекта нет? До 2016 года ответ почти всегда брался из параметрической модели, описывающей поведение случайного шума в пространстве.

Андерс Эклунд, Томас Николс и Ханс Кнутссон проверили эту модель прямо. Они взяли данные покоя 499 здоровых испытуемых, то есть людей, которые в томографе просто лежали. И обработали эти данные так, будто в исследовании была задача, разбив записи на «условия» по искусственным планам. Задачи не было, значит, всякая находка заведомо ложная. Таких групповых анализов провели три миллиона.

Результат: при заявленной частоте ошибок 5 % параметрические методы оказались консервативными для воксельного вывода и недействительными для кластерного. В наиболее мягких настройках порога определения кластера доля ложных срабатываний доходила до 70 %. Названная авторами причина не в программах, а в допущении. Пространственная автокорреляционная функция шума не имеет предполагаемой гауссовой формы, её хвост тяжелее. Потому крупные пятна возникают случайно чаще, чем предсказывает модель.

Непараметрический перестановочный тест это процедура, которая вместо модели шума многократно перемешивает сами данные и смотрит, какие кластеры получаются. Он удержал заявленную частоту ошибок и в воксельном выводе, и в кластерном. Это существенная часть результата: она показывает, что сломан не метод и не прибор, а одно конкретное допущение одной конкретной поправки.

об источникеПочему нужны были именно данные покоя

Проверить процедуру вывода можно только там, где правильный ответ известен заранее. Записи людей, лежащих в томографе без задания, дают материал, в котором связанной с задачей активности быть не может по построению. Всё, что процедура объявит находкой на таких данных, ложно, и остаётся сосчитать долю и сравнить с той, которую процедура сама себе назначила.

Поправка, которую пришлось внести самой критике

В изложении для широкого читателя авторы написали: «Эти результаты ставят под вопрос достоверность около 40 000 фМРТ-исследований». Фраза разошлась по прессе мгновенно и стала тем, что запомнили вместо содержания работы.

В августе 2016 года PNAS напечатал поправку. Стало: «Эти результаты ставят под вопрос достоверность ряда фМРТ-исследований и могут существенно повлиять на истолкование слабо значимых нейровизуализационных результатов». Смягчена и вторая фраза, о невозможности переделать 40 000 исследований.

Разберём, что было не так с числом. Сорок тысяч это примерно всё, что вообще опубликовано методом фМРТ. Проблема же касалась кластерного вывода при мягком пороге. Часть работ пользовалась воксельным выводом, который оказался консервативным, а часть перестановочными методами. А во многих вывод не висел на том, дотянул ли кластер до порога на волосок. Число работ, где заключение действительно держится на исправленной процедуре, во много раз меньше.

Спорили и о величине. Разработчики пакета AFNI ответили отдельной работой. В ней они утверждали, что «упор на самый худший результат из тысяч случаев симуляции сильно преувеличил масштаб проблемы». Их довод: доля ложных срабатываний заметно зависит от плана исследования и от выбранного воксельного порога. Там же описаны исправления и перестановочные процедуры, дающие долю, плотно собранную около пяти процентов. Заметим и обратное направление: в самой статье 2016 года указана пятнадцатилетняя ошибка в программе 3dClustSim пакета AFNI, исправленная разработчиками ещё в мае 2015 года. Она занижала строгость поправки.

И вот второй урок этого сюжета, не менее важный, чем первый. Критика метода подчиняется тем же требованиям, что и метод. Броское число в заявлении для прессы тоже служит утверждением, и обосновывать его надо так же, как всё остальное. Когда обоснования не нашлось, формулировку исправили. Правильное чтение этой истории не «критикам тоже нельзя верить», а «исправление опубликованной формулировки это работающая процедура, а не признание поражения». Механизм, найденный Эклундом, Николсом и Кнутссоном, остался в силе целиком. Исправлена оценка охвата.

осторожноЧисло, которое запомнили вместо результата

Из работы 2016 года публика вынесла «сорок тысяч исследований под вопросом», единственное утверждение, которое авторам пришлось отозвать. Так бывает часто: в пересказ уходит самая крупная цифра, а не самое прочное наблюдение. Полезное следствие для чтения новостей состоит в том, чтобы искать в работе не самое сильное её утверждение, а самое проверенное.

Что изменилось и что искать в работе

После 2016 года практика заметно сдвинулась. Перестановочные методы из экзотики стали нормой. Порог определения кластера ужесточился. Требования к отчётности выросли: теперь принято указывать, каким способом получен вывод и при каком пороге, а не ограничиваться словом «значимо».

Отсюда рабочая формулировка. Утверждение «фМРТ-исследования недостоверны» не то, что показали эти работы. Показали другое: одна процедура вывода не удерживала заявленную частоту ошибок, а одна практика анализа систематически завышала корреляции. Обе претензии относятся к процедурам, а не к физике измерения, и обе уже привели к смене процедур. Держать это различие важно ещё и потому, что широкая версия удобна для отказа от разговора: если «картинкам мозга верить нельзя», то и разбирать конкретную работу незачем.

Читателю остаются три вопроса, и все три отвечаются по разделу «методы», а не по картинке. Первый: как выбрана область, по которой сообщается величина, не по тем ли данным, по которым потом считался эффект? Второй: каким способом получен вывод, воксельным, кластерным или перестановочным, и при каком пороге определения кластера? Третий: какого года работа. Для кластерного вывода до 2016 года и после это разный уровень доверия.

И общее замечание, ради которого оба сюжета стоят рядом. Ни одна из этих проблем не видна в результате. Завышенная корреляция выглядит как хорошая корреляция, ложный кластер выглядит как настоящий, и никакое разглядывание картинки их не различает. Различает только знание о том, как получено число, поэтому раздел «методы» читается раньше раздела «результаты», а картинка не является доказательством ни в каком случае.

Ключевые работы

Edward Vul, Christine Harris, Piotr Winkielman, Harold Pashler, «Puzzlingly High Correlations in fMRI Studies of Emotion, Personality, and Social Cognition», Perspectives on Psychological Science 4(3), 274-2902009Опрошены авторы 55 статей, ответили 53. У 53 % ответивших воксели отбирались по силе связи с поведенческой мерой, и по ним же считалась величина связи. Потолок из надёжностей около 0,74, а сообщавшиеся величины его превышали.
Anders Eklund, Thomas Nichols, Hans Knutsson, «Cluster failure: Why fMRI inferences for spatial extent have inflated false-positive rates», PNAS 113(28), 7900-79052016Данные покоя 499 испытуемых, три миллиона групповых анализов без задачи. Параметрический кластерный вывод недействителен, доля ложных срабатываний доходит до 70 %. Причина в негауссовой форме пространственной автокорреляции шума. Перестановочный тест удержал заявленную частоту.
Поправка к Eklund и др., PNAS2016Заявление «ставят под вопрос достоверность около 40 000 фМРТ-исследований» заменено на «ставят под вопрос достоверность ряда фМРТ-исследований и могут существенно повлиять на истолкование слабо значимых результатов».
Robert Cox, Gang Chen, Daniel Glen, Richard Reynolds, Paul Taylor, «FMRI Clustering in AFNI: False-Positive Rates Redux», Brain Connectivity 7(3), 152-1712017Возражение разработчиков AFNI: упор на худший из тысяч смоделированных случаев преувеличил масштаб, а доля ложных срабатываний зависит от плана и воксельного порога. Описаны исправления и перестановочные процедуры, дающие долю около 5 %.

Что подтвердилось, а что нет

сильно ослабленофМРТ-исследования недостоверны.

Держится в узкой форме, а в ходу в широкой. Узкая форма: параметрическая поправка при кластерном выводе не удерживала заявленную частоту ошибок, и расхождение сильнее при мягких порогах определения кластера (Эклунд, Николс, Кнутссон, 2016). Отбор вокселей по силе связи с последующим подсчётом связи на тех же данных систематически завышал корреляции (Вул и коллеги, 2009). Обе претензии относятся к процедурам анализа, а не к измерению: перестановочный тест на тех же самых данных удержал заявленную частоту, а воксельный вывод оказался даже консервативным. После 2016 года практика изменилась. Широкая форма, «картинкам мозга верить нельзя», из этих работ не следует и ими не подтверждается.

отвергнутоCluster failure поставил под вопрос около 40 000 фМРТ-работ.

Фраза стояла в изложении для широкого читателя и была исправлена самими авторами: в поправке PNAS (август 2016) она заменена на «ставят под вопрос достоверность ряда фМРТ-исследований». Сорок тысяч это примерно весь объём опубликованного методом фМРТ, а не число работ, где вывод держится на кластерной процедуре при мягком пороге. Отдельно спорили о величине: разработчики AFNI (Кокс и коллеги, 2017) сочли, что упор на худший из тысяч смоделированных случаев преувеличил масштаб. Сам механизм при этом не оспорен никем. Исправлена оценка охвата, и это стоит рассказывать вместе с самой критикой.

отвергнутоДвойное погружение это подтасовка, и добросовестному автору она не грозит.

Такая работа не содержит ни одного ложного утверждения: воксели действительно отобраны, корреляция действительно посчитана, число действительно получено. Завышение вносит не поступок, а порядок действий, когда отбор и оценка идут по одному признаку на одних данных. Именно поэтому 53 % опрошенных Вулом и коллегами (2009) спокойно описали свою процедуру в ответном письме: она не выглядела нарушением, да и нарушением не была. Отсюда и лечение процедурное, а не моральное: область определяется по одним данным, величина связи считается по другим.

выдержалоПараметрический кластерный вывод в фМРТ не удерживает заявленную частоту ложных срабатываний.

Эклунд, Николс и Кнутссон (2016) прогнали три миллиона групповых анализов на данных покоя 499 человек, на записях, где никакого эффекта быть не могло. Доля ложных срабатываний дошла до 70 % там, где заявлялось 5 %, и причина в негауссовой форме пространственной автокорреляции шума. Ядро результата выдержало возражения. Его масштаб не устоял, и различать это обязательно. Авторам пришлось заменить заявление про «около 40 000 исследований» на осторожное, а разработчики AFNI показали, что упор на худший из смоделированных случаев картину преувеличил и что доля зависит от плана и воксельного порога (Кокс и коллеги, 2017). Механизм при этом остался в силе, и практика изменилась: перестановочный тест заявленную частоту удерживает.

Термины

двойное погружениеdouble dipping, non-independence
Отбор данных по некоторому критерию и оценка величины эффекта по тому же критерию на тех же данных. Систематически завышает результат.
независимый отбор вокселейindependent voxel selection
Правило, при котором воксели области определяются по одним данным, а величина эффекта считается по другим: по отдельному прогону, отдельной группе или отложенной половине наблюдений.
надёжность измеренияreliability
Доля устойчивой части в измерении. Оценивается корреляцией двух замеров одной величины у тех же людей. Ограничивает сверху корреляцию этой величины с чем бы то ни было.
потолок наблюдаемой корреляцииattenuation ceiling
Предел: наблюдаемая корреляция не превосходит истинной связи, умноженной на корень из произведения надёжностей обоих измерений. Для типичных надёжностей фМРТ и личностных шкал он около 0,74.
кластерный выводcluster-extent inference
Процедура, в которой значимым объявляется не отдельный воксель, а связное пятно перешедших порог вокселей, и решение принимается по размеру этого пятна.
порог определения кластераcluster-defining threshold
Воксельный порог, по которому решается, какие воксели войдут в кластер. Чем он мягче, тем крупнее случайные пятна и тем сильнее параметрическая поправка расходилась с действительностью.
доля ложных срабатыванийfalse-positive rate
Доля анализов, в которых объявлена находка при полном отсутствии эффекта. Заявляется равной пяти процентам, а при кластерном выводе с мягким порогом доходила до семидесяти.
перестановочный тестpermutation test
Непараметрическая процедура: распределение случайных исходов строится многократным перемешиванием самих данных, а не берётся из модели шума. В проверке 2016 года удержал заявленную частоту ошибок.

Практикум · Как получено это число

Задача состоит в том, чтобы на одной чужой работе пройти обе проверки этого урока: независимость отбора и способ вывода. Понадобится статья с фМРТ в открытом доступе, где сообщается связь активности с поведенческим или личностным показателем. 30-45 минут.

  1. Выпишите главное число работы одной строкой: какая величина, между чем и чем, на скольких участниках.
  2. Найдите в разделе «методы», как определена область, по которой это число посчитано: по анатомии, по отдельному локализаторному прогону, по отложенной части данных или по тому же контрасту, из которого затем взята величина. Отметьте, какой из четырёх случаев перед вами.
  3. Найдите способ вывода, воксельный, кластерный или перестановочный, а также порог определения кластера и год выхода работы. Если способ не назван, зафиксируйте и это: до 2016 года такое умолчание было обычным.
  4. Найдите или оцените надёжности обеих мер (для опросника её обычно сообщают, для фМРТ примите 0,7). Посчитайте потолок, корень из произведения, и сравните с числом из первого шага.
  5. Напишите три строки: что этой работой показано, что не показано, и какое одно сведение из раздела «методы» сильнее всего меняет доверие к её главному числу.

Вопросы для самопроверки

Вопрос 1

В работе сообщается корреляция 0,85 между сигналом области и баллом шкалы тревожности. Надёжность шкалы около 0,8, надёжность воксельного сигнала около 0,7. Что можно сказать сразу?

  • Что связь сильная и хорошо установлена, раз величина близка к единице
  • Что величина выше потолка, который ставят надёжности измерений, и значит, в процедуре есть неописанный шаг
  • Что надёжности слишком низкие, чтобы вообще что-то считать: при таких величинах корреляция между двумя мерами лишена смысла
  • Что величину надо поправить на ослабление измерений, и тогда она станет ещё выше
Вопрос 2

Исследователь отобрал воксели, где корреляция с поведенческой мерой оказалась выше 0,5, и сообщил среднюю корреляцию по отобранным. Что означает полученное число?

  • Оно занижено, потому что усреднение сглаживает разброс
  • Оно верно, если сделана поправка на множественные сравнения
  • Оно верно, но применимо только к этим вокселям
  • Оно завышено по построению: отбор и оценка сделаны по одному признаку на одних данных
Вопрос 3

Эклунд, Николс и Кнутссон обрабатывали записи покоя так, будто в исследовании была задача. Зачем?

  • Чтобы получить материал, где всякая находка заведомо ложная, и посчитать, как часто процедура их выдаёт
  • Чтобы сравнить активность покоя с активностью при задаче и увидеть, чем занят мозг, когда ничего не делает
  • Чтобы набрать больший объём выборки за счёт уже собранных записей
  • Чтобы проверить, различают ли программы обработки задачу и покой между собой
Вопрос 4

Перестановочный тест на тех же самых данных удержал заявленную частоту ошибок. Что из этого следует?

  • Что данные покоя не годятся для такой проверки и полученная доля ложных срабатываний к настоящим исследованиям отношения не имеет
  • Что фМРТ измеряет не то, что предполагалось: сосудистый сигнал вовсе не связан с работой нейронов под ним
  • Что сломано конкретное допущение параметрической модели, а не измерение и не идея кластерного вывода
  • Что кластерный вывод в принципе невозможен и от пятен придётся отказаться
Вопрос 5

Авторы cluster failure написали, что под вопросом оказываются около 40 000 работ, а затем напечатали поправку с более мягкой формулировкой. Как это читать?

  • Оценка охвата не была обоснована и была исправлена, а найденный механизм это не отменяет
  • Работа отозвана, и пользоваться её результатами нельзя
  • Авторы уступили давлению, поэтому исходная формулировка вернее
  • Значит, кластерный вывод всё-таки удерживает заявленную частоту ошибок

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Edward Vul, Christine Harris, Piotr Winkielman, Harold Pashler, «Puzzlingly High Correlations in fMRI Studies of Emotion, Personality, and Social Cognition», Perspectives on Psychological Science, 2009: Читается легко и целиком стоит того: рассуждение о потолке, опрос авторов и разбор механизма на примере с акциями и термометром.
  • Anders Eklund, Thomas Nichols, Hans Knutsson, «Cluster failure», PNAS, 2016, вместе с поправкой того же года: Читать именно вместе с поправкой: без неё теряется вторая половина урока о том, что критика тоже подлежит проверке.
  • Robert Cox и др., «FMRI Clustering in AFNI: False-Positive Rates Redux», Brain Connectivity, 2017: Возражение разработчиков программ. Полезно как образец спора о величине эффекта при согласии о механизме.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Мозг и нейронаука»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?