Фактчекинг: SIFT и латеральное чтение
SIFT и латеральное чтение: путь до первоисточника за пять минут
Латеральное чтение означает оценку источника снаружи: не вчитываться в сайт, а открыть соседнюю вкладку и посмотреть, что пишут о нём независимые. Метод SIFT упаковывает приём в четыре шага: остановись, выясни источник, найди другие сообщения, дойди до оригинала. Паниковать при этом не от чего: по данным Аллена с соавторами (2020) фейковые новости занимают 0,15 % ежедневного медиарациона.
Модуль VI. Медиа и манипуляции · навыки Е1 · 22 мин · обновлено 12.09.2026
После урока вы сможете
- Метод SIFT и латеральное чтение: дойти до первоисточника и посмотреть, кто, на ком и за чьи деньги.
В 2018 году в журнале Science вышло исследование, ради которого учёные разобрали больше ста тысяч новостных цепочек в соцсети за двенадцать лет, с 2006-го по 2017-й. Вопрос был простой: что распространяется быстрее, правда или ложь?
Ложь. И вот аккуратная формулировка результата, потому что неаккуратная гуляет по пересказам. Авторы построили модель вероятности ретвита с поправками на возраст аккаунта, его активность, число подписчиков и подписок и на то, верифицирован ли автор. По этой модели ложь ретвитили на 70 % чаще правды. Это коэффициент модели с поправками, а не сырая доля репостов. Разница между первым и вторым такая же, как между «выше на голову» и «выше на голову при равном росте родителей».
Ещё два числа оттуда же, и они говорят громче процента. До полутора тысяч человек правда шла вшестеро дольше лжи. До глубины перепоста в десять шагов она шла в двадцать раз дольше. А вот сетевые преимущества были как раз на стороне правды: распространявшие ложь имели меньше подписчиков, были менее активны и реже верифицированы.
И про ботов тоже скажем точно, потому что «боты ни при чём» звучит хлёстко и неверно. Авторы удалили ботов перед анализом, а потом вернули обратно. Выводы не изменились: боты ускоряли распространение и правды, и лжи, и примерно одинаково. Значит, они не объясняют разницу между ними, и это не то же, что «ни при чём». Разрыв делают люди. Ложь просто интереснее: она новее, неожиданнее, эмоциональнее. Правда скучна, у неё нет отдела маркетинга.
И сразу возражение: что осталось от «глубже, шире, виральнее»
Курс не имеет права рассказать половину истории и уйти. У работы 2018 года есть сильное возражение, и оно опубликовано в PNAS в 2021 году.
Юуль и Угандер взяли те же данные и сравнили каскады одинакового размера. Структурные различия между путями распространения правды и лжи при таком сравнении, по их словам, исчезают. Почти целиком они объясняются тем, что каскады лжи попросту крупнее.
Что это меняет практически? Главное остаётся: ложь доходит до большего числа людей, и делают это люди, а не роботы. Но красивая формулировка «у лжи другая физика распространения, она идёт глубже и разветвлённее» не подтвердилась. Да, крупнее. Нет, иначе не устроена.
Заметь, что здесь произошло, это важнее самого факта. Никто никого не поймал на подлоге. Взяли те же данные, задали более строгий вопрос, и часть выводов не пережила уточнения. Так и выглядит нормальная жизнь научного результата, и любой курс, который цитирует громкую статью без её возражений, продаёт вам её первую редакцию.
Сколько на самом деле фейков в вашей ленте
Теперь противоядие от передозировки. После такого урока легко выйти с ощущением, что вокруг сплошной обман и доверять нельзя ничему. Числа этого не поддерживают.
Аллен с соавторами (Science Advances, 2020) считали медиапотребление американцев по национально репрезентативным панелям за 2016-2018 годы. Новости любого рода занимают не более 14,2 % всего медиапотребления. На фейковые новости приходится 0,15 % ежедневного медиарациона. Пятнадцать сотых процента.
Гринберг с соавторами (Science, 2019) сопоставили 16 442 твиттер-аккаунта с записями регистрации избирателей. Один процент людей дал 80 % всех контактов с источниками фейковых новостей. У людей любых политических взглядов основная часть политических новостей приходила из массовых изданий.
Складывается неожиданная картина. Фейки не потоп, а концентрированное явление: их много у очень небольшой группы и почти нет у всех остальных. Значит, и защита строится иначе. Не «проверяй всё подряд, вокруг ложь», а «знай приёмы и умей проверить то немногое, что собираешься принять всерьёз».
Гиперкоррекция здесь стоит дорого. Человек, решивший, что врут все, перестаёт отличать издание с репутацией и ссылками от анонимного канала со скрином и становится удобнее для обмана, а не защищённее. Недоверие тоже бывает избыточным, и в модуле 6 мы вернёмся к этому отдельным разговором.
Почему «вчитаться внимательнее» не работает
Интуитивная стратегия проверки велит прочитать внимательно: оценить стиль, логику, оформление, раздел «О нас». Уайнбург и Макгрю из Стэнфорда устроили очную ставку. Сорок пять человек оценивали одни и те же сайты: десять профессиональных фактчекеров, десять историков с докторской степенью и двадцать пять первокурсников Стэнфорда.
Разрыв в двух заданиях из трёх оказался разгромным. В задании про сайт-ширму фактчекеры находили настоящего владельца в среднем за 51 секунду, историки за 3 минуты 40 секунд, студенты за 5 минут 18 секунд. Восемь из десяти студентов за первые пять минут вообще не потратили ни секунды на вопрос, кто стоит за сайтом. А в другом задании сайт маленькой отколовшейся группы стоял против сайта профессиональной ассоциации. Там историки, люди с научной степенью, семь раз из десяти назвали признаком достоверности список литературы внизу страницы. Из десяти ссылок в нём одна вела в бесплатный словарь, а две в блоги.
А вот третье задание курс раньше замалчивал, и зря, ведь оно интереснее остальных. Там надо было выяснить, кто оплатил судебные издержки. Быстрее всех справились студенты: 1 минута 42 секунды. Историки потратили 2 минуты 1 секунду, фактчекеры 2 минуты 8 секунд, то есть оказались самыми медленными. Зато по качеству вывода фактчекеры снова первые: 3,6 против 2,4 у историков и 2,3 у студентов. Пятнадцать студентов из двадцати пяти получили 0, 1 или 2 балла, а у фактчекеров все ответы, кроме одного, оценены на 3 и 4.
Вывод из этого точнее и полезнее лозунга. Фактчекеры не «всегда быстрее». Они приходят к обоснованному выводу за долю того времени, которое остальные тратят на необоснованный, а где нужно, тратят время на сверку по нескольким источникам и проигрывают в скорости сознательно. И честная оговорка от самих авторов: в каждой группе по десять человек, и «малые выборки преувеличивают различия».
Их секрет обескураживал: они почти не читали сам сайт. С посадочной страницы фактчекеры уходили в среднем через 32 секунды. Вместо чтения они открывали соседнюю вкладку и смотрели, что пишут об этом источнике другие: кто владелец, кто финансирует, ловили ли на фейках. Это называется латеральным чтением, то есть чтением «вбок» вместо чтения «вглубь». Логика железная: сайт расскажет о себе только хорошее, и оценивать его изнутри всё равно что спрашивать продавца, честный ли он. Убедительный вид подделки не случайность, а её рабочий инструмент.
SIFT: четыре шага за пять минут
Из практики фактчекеров собран метод SIFT: четыре шага, каждый по минуте-другой.
S значит Stop. Остановись. Особенно если внутри уже вспыхнуло: возмущение, страх, злорадное «я так и знал!». Сильная эмоция не повод делиться, а сигнал проверить: вирусные фейки сконструированы бить в эмоцию, потому что эмоция отключает проверку и включает репост. Помнишь «Stop» из склонности к подтверждению: «я так и знал» и есть самое опасное чувство в этом модуле.
I значит Investigate the source. Выясни, кто говорит. Латерально: не «О нас», а соседняя вкладка и то, что пишут об источнике независимые. Две минуты, и «Международный институт исследований здоровья» оказывается сайтом производителя добавок.
F значит Find better coverage. Найди, кто ещё сообщает. Значимое событие оставляет следы во многих независимых источниках, и это твоя проверка «кто ещё в выборке» из модуля 4. Громкая новость, живущая в одном анонимном канале, уже сама по себе красный флаг. И наоборот: если тему разобрал сильный фактчекерский ресурс, можно опереться на их маршрут (корректная апелляция к профильной работе, тесты из модуля 2 пройдены).
T значит Trace to the original. Дойди до первоисточника. Заголовки работают как испорченный телефон: «Учёные доказали, что шоколад спасает от старения» на четыре пересказа отстоит от статьи «у 30 мышей на диете с флаванолами какао маркер X изменился на Y%». Дойди до оригинала и задай ему четыре вопроса из арсенала модуля 4: кто делал (профильность, конфликт интересов), на ком (мыши? 20 добровольцев? 40 000 человек?), что реально показано (корреляция или эксперимент?) и кто платил.
Пять минут SIFT не делают тебя экспертом по теме, но делают человеком, которого дорого обмануть. Для ленты этого достаточно: проверять всё не нужно, нужно проверять то, что собираешься принять как правду или передать дальше.
В чате пересылают скрин «статьи учёных», то есть картинку с заголовком и абзацем, без ссылки, 50 тысяч репостов. Три вопроса: повышают ли репосты достоверность? какой шаг SIFT здесь главный? сколько времени он займёт?Показать ответ
репосты измеряют заразность, не истинность (само исследование Science ровно об этом, заодно это апелляция к большинству из модуля 2). Главный шаг тут T: обратным поиском найти первоисточник «статьи». Скрин без ссылки это классический формат фейка именно потому, что рвёт цепочку до оригинала. Займёт две-три минуты и чаще всего закончится на том, что статьи не существует или она о другом.
Честно про сам метод SIFT
Прежде чем ты унесёшь эти четыре буквы в жизнь, курс обязан сказать про них то, чего обычно не говорят.
SIFT не проверяли. Метод придумал Майк Колфилд. Опубликован он в личном блоге и в открытом учебнике. Рецензирования у него нет, испытаний «SIFT против контрольной группы» не существует. Ближайшие работы проверяли другую программу обучения, и Колфилд в них соавтор.
А вот ядро метода проверяли, и оно работает. Латеральное чтение испытали на 230 первокурсниках (Бродски с соавторами, 2021). Доля получивших высший балл выросла с 7 % до 28,7-43,7 % против 0-1,2 % в контрольных группах. Там же есть отрезвляющая деталь: рост самооценки навыка с реальным результатом не коррелировал. Люди, которые почувствовали себя лучше, не те же самые люди, которые стали лучше.
Как это читать? SIFT это удобная упаковка для приёма, у которого есть измерения, а не самостоятельный проверенный метод. Пользоваться им стоит, а называть его «научно доказанным» нельзя. Разница между этими двумя фразами и есть предмет всего курса.
Отдельная оговорка про детекторы ботов, раз уж мы их упоминали. Тот, которым пользовались в работе 2018 года, позже проверили на 4134 верифицированных аккаунтах живых людей. При рекомендованных порогах он принимал за ботов 41 % реальных людей на англоязычных данных и 76 % на немецкоязычных. Инструмент проверки сам нуждается в проверке, и это не остроумие, а рабочее правило.
Ты читаешь разгромный материал о компании на незнакомом сайте: аккуратный дизайн, много деталей, тон взвешенный. Что сделает фактчекер в первые 60 секунд и почему не то, что сделал бы прилежный читатель?Показать ответ
прилежный читатель начнёт вчитываться в аргументы и попадёт в ловушку оценки подделки по качеству подделки. Фактчекер уйдёт с сайта: соседняя вкладка, «кто владеет, кто пишет об этом источнике, ловили ли на заказных материалах». Так и работает латеральное чтение. Содержание имеет смысл разбирать только после того, как источник прошёл минимальный досмотр.
Конспект
Ложь расходится дальше правды: по модели с поправками её ретвитили на 70 % чаще, до полутора тысяч человек правда шла вшестеро дольше (Science, 2018, двенадцать лет данных, 2006-2017). Это коэффициент модели, а не сырая доля. Боты ускоряли и правду, и ложь примерно одинаково, и значит, разницу делают люди, а не «боты ни при чём». Возражение: при сравнении каскадов одинакового размера структурные различия исчезают (Juul & Ugander, 2021), то есть ложь крупнее, а не устроена иначе. Масштаб: на фейки приходится 0,15 % медиарациона, 1 % людей даёт 80 % контактов с ними. А «врут все» это гиперкоррекция, которая делает уязвимее. «Вчитаться» не работает: подделка убедительна по определению, а фактчекеры читают латерально (уходят со страницы за 32 секунды, владельца сайта-ширмы находят за 51 секунду против 3 мин 40 с у историков), но в третьем задании они были самыми медленными и самыми точными. SIFT: Stop → Investigate → Find better coverage → Trace. Сам метод не испытан, а латеральное чтение испытано (7 % → 28,7-43,7 % против 0-1,2 % в контроле). Проверяй то, что готов принять или передать.
Ключевые работы
| Vosoughi, Roy & Aral | 2018 | Около 126 000 каскадов слухов, 3 миллиона человек, 4,5 миллиона твитов за 2006-2017 годы: по модели с поправкой на характеристики аккаунта ложь ретвитили на 70 % чаще правды, а до полутора тысяч человек правда шла вшестеро дольше. Боты ускоряли и правду, и ложь примерно одинаково. |
| Wineburg & McGrew | 2019 | 10 профессиональных фактчекеров, 10 историков с докторской степенью и 25 первокурсников Стэнфорда оценивали одни и те же сайты: фактчекеры уходили со страницы в среднем через 32 секунды и находили владельца сайта-ширмы за 51 секунду, историки за 3 минуты 40 секунд, студенты за 5 минут 18 секунд. |
| Grinberg и др. | 2019 | 16 442 твиттер-аккаунта, сматченных с записями регистрации избирателей: 1 % людей дал 80 % контактов с источниками фейковых новостей, и у людей всех политических взглядов основная часть политических новостей приходила из массовых изданий. |
| Allen и др. | 2020 | Национально репрезентативные панели за 2016-2018 годы: новости любого рода составляют не более 14,2 % медиапотребления американцев, а на фейковые новости приходится 0,15 % ежедневного медиарациона. |
| Rauchfleisch & Kaiser | 2020 | 4134 верифицированных аккаунта: при рекомендованных порогах автоматический детектор ботов принимал за ботов 41 % реальных людей на англоязычных данных и 76 % на немецкоязычных. |
| Brodsky и др. | 2021 | 230 первокурсников: после обучения латеральному чтению доля получивших высший балл выросла с 7 % до 28,7-43,7 % против 0-1,2 % в контрольных группах. При этом рост самооценки навыка с реальным результатом не коррелировал. |
| Juul & Ugander | 2021 | Переанализ тех же твиттер-данных: различия в глубине и ширине распространения правды и лжи исчезают, если сравнивать каскады одинакового размера. Почти целиком они объясняются тем, что каскады лжи крупнее. |
Разбор
Юуль и Угандер (PNAS, 2021) переанализировали те же данные, сравнивая только каскады одинакового размера. Структурные различия между путями распространения правды и лжи при этом исчезают, а сами различия почти целиком объясняются тем, что каскады лжи крупнее. Что остаётся: ложь действительно доходит до большего числа людей, и разгоняют её люди, а не боты. Что не остаётся: представление об особом устройстве распространения лжи.
Метод придумал Майк Колфилд. Опубликован он в личном блоге (2019) и открытом учебнике (2017). Рецензирования нет, испытаний «SIFT против контроля» не существует вовсе, а ближайшие исследования проверяли другую программу обучения, в которых Колфилд соавтор. При этом ядро метода, латеральное чтение, проверено: у 230 первокурсников доля высших баллов выросла с 7 % до 28,7-43,7 % против 0-1,2 % в контроле (Бродски и др., 2021). Правильная формулировка: удобная упаковка проверенного приёма, а не проверенный метод.
Аллен и соавторы (Science Advances, 2020) на национально репрезентативных панелях: новости любого рода занимают не более 14,2 % медиапотребления американцев, а на фейковые новости приходится 0,15 % ежедневного медиарациона. Гринберг и соавторы (Science, 2019): 1 % людей дал 80 % контактов с фейковыми источниками. Явление концентрированное, а не всеобщее. Вывод «врут все» из этих данных не следует и вредит: человек, переставший различать издание со ссылками и анонимный канал со скрином, становится удобнее для обмана, а не защищённее.
Уайнбург и Макгрю дали одни и те же сайты трём группам: 10 профессиональным фактчекерам, 10 историкам с докторской степенью и 25 первокурсникам Стэнфорда. Фактчекеры уходили со страницы в среднем через 32 секунды и находили владельца сайта-ширмы за 51 секунду. Историкам на то же требовалось 3 минуты 40 секунд. Приём переносится обучением: у Бродского и соавторов (230 первокурсников) доля высших баллов выросла с 7 % до 28,7-43,7 % против 0-1,2 % в контрольных группах. Оговорок две. Измерен приём, а не бренд: у SIFT как оформленного метода испытаний нет, и это соседняя позиция реестра. И рост самооценки навыка с реальным результатом не коррелировал.
Термины
- Латеральное чтениеlateral reading
- Оценка источника снаружи: не вчитываться в сайт, а открыть соседнюю вкладку и посмотреть, что пишут о нём независимые. Приём профессиональных фактчекеров, у которого есть измеренный эффект обучения.
- SIFTSIFT (stop, investigate, find, trace)
- Четыре шага быстрой проверки: остановись, выясни источник, найди другие сообщения, дойди до оригинала. Удобная упаковка для латерального чтения. Сам набор из четырёх шагов испытаниям не подвергался.
- Каскад распространенияdiffusion cascade
- Цепочка перепостов, выросшая из одной публикации. Меряется размером (сколько людей), глубиной (сколько шагов пересылки) и шириной. Сравнение каскадов разного размера по форме даёт ошибку, из-за которой часть выводов о лжи не устояла.
- Сайт-ширмаfront group site
- Сайт, оформленный как независимый источник, за которым стоит незаявленная заинтересованная организация. Опознаётся не изнутри, а снаружи: вопрос «кто владелец» решается за минуту в соседней вкладке.
- Детектор ботовbot detector
- Программа, отличающая автоматические аккаунты от живых людей по поведению. На проверке живых верифицированных аккаунтов давала 41 % ложных срабатываний на английских данных и 76 % на немецких, так что инструмент проверки сам нуждается в проверке.
- Сопоставление по размеруmatching on cascade size
- Приём переанализа: сравнивать только объекты одинакового размера, чтобы отличить настоящее различие формы от следствия различия масштаба. Именно им из выводов о распространении лжи вычли то, что объяснялось размером.
- Медиарационmedia diet
- Доля разных источников в общем времени, которое человек тратит на медиа. Считается от всего потребления, а не от новостей: фейковые новости дают 0,15 % рациона, и без знаменателя это число теряет смысл.
- Обратный поиск изображенияreverse image search
- Поиск по картинке, а не по словам. Основной инструмент шага «дойди до первоисточника» для скриншотов и фотографий: чаще всего показывает, что снимок сделан в другом месте и в другом году.
Практикум · Фактчек-спринт
Задание модуля из курса: пройти путь до первоисточника. На время, потому что в реальности времени всегда мало.
- Выберите три утверждения, которые вам недавно попались: одно из новостей, одно из соцсетей, одно из разговора.
- На каждое отведите пять минут по методу SIFT: остановиться, проверить источник снаружи, найти другие сообщения, дойти до оригинала.
- Для каждого запишите маршрут: что нашли, где остановились, чего не хватило.
- Для того, где дошли до исследования, ответьте: кто авторы, на ком проводилось, сколько участников, кто финансировал.
- Вынесите вердикт по шкале: правда · правда, но · вводит в заблуждение · неправда.
Вопросы для самопроверки
Как быстро оценить незнакомый сайт, опубликовавший «сенсацию»?
- Прочитать раздел «О нас»: там сайт сам расскажет, кто за ним стоит
- Оценить дизайн: солидный сайт не станет врать
- Посчитать количество рекламы на странице
- Латеральное чтение: посмотреть, что пишут об этом сайте независимые источники
Пост: «В городе N ввели штраф за сбор дождевой воды», ссылка на сайт «Вестник N», и сайт существует, статья есть. Каков следующий шаг латерального чтения?
- Посмотреть число репостов и охват: тысячи поделившихся людей не могут ошибаться
- Прочитать комментарии под статьёй
- Проверить дизайн и грамотность статьи: у солидного, аккуратно свёрстанного сайта больше оснований для доверия
- Проверить, кто ещё сообщает: сайт города, другие издания, ведь новость из одного источника подозрительна
В ленте попадается «свежее исследование: умные лампы снижают усталость глаз». Ты дошёл до первоисточника: это пресс-релиз производителя ламп об опросе 40 его покупателей. Что это меняет?
- Ничего: первоисточник найден и он существует, значит, заголовок полностью подтверждён
- Меняет только тон подачи: сам вывод верен, просто сформулирован чересчур смело
- Почти всё: источник заинтересован, а опрос мнений не исследование зрения
- Немного: производитель всё-таки знает свой продукт лучше посторонних исследователей
Две подачи одной новости: (1) информагентство со ссылкой на опубликованный документ и именами, (2) анонимный канал со скрином «инсайда» без ссылок. Как распределить доверие?
- Никому: за любой новостью чей-то интерес, а проверить её обычному человеку всё равно нечем
- Больше первому: проверяемые детали и репутационная ответственность дают вес
- Поровну: соврать может кто угодно, и анонимный канал, и агентство с именами и ссылками
- Второму: инсайды ценнее официальных сообщений, их для того и публикуют анонимно
Отзыв: «Кофе тут варят долго, столики липкие, но десерты волшебные. В целом заведение скорее разочаровывает». Тезис?
- Кофе варят слишком долго
- Десерты в этом заведении просто отличные
- Заведение скорее разочаровывает
- Хорошее кафе узнаётся по десертам
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Vosoughi, Roy & Aral, «The spread of true and false news online», Science, 2018: Та самая статья. Смотреть стоит не аннотацию, а раздел про ботов и признание авторов о возможном смещении выборки: в аннотации этого нет, а половина корректных оговорок именно там.
- Juul & Ugander, «Comparing information diffusion mechanisms by matching on cascade size», PNAS, 2021: Возражение к предыдущей строке. Читать их подряд полезнее, чем по отдельности: видно, как одна и та же таблица данных отвечает на два по-разному заданных вопроса.
- Allen и др., «Evaluating the fake news problem at the scale of the information ecosystem», Science Advances, 2020: Отрезвляющий счёт знаменателей. Полезен ровно там, где после урока о фейках хочется сделать вывод «доверять нельзя ничему».