Можно ли предсказать преступление
Простая формула прогнозирует поведение не хуже специалиста, но и она уверенно называет тех, кто скорее всего не нарушит, а не тех, кто нарушит
Предсказать преступление или рецидив точно нельзя, но простая формула прогнозирует поведение не хуже опытного специалиста, а часто лучше. В метаанализе Гроува и соавторов 2000 года из 136 исследований 63 вышли в пользу формулы, 65 поровну и 8 в пользу специалиста. Инструменты оценки риска надёжно выделяют людей низкого риска: из 100 отнесённых к умеренному или высокому риску насилие совершил в среднем 41, а из 100 отнесённых к низкому не совершил 91.
Собран по первоисточникам: метаанализ Гроува и соавторов 2000 года, метаанализ Фазела и соавторов 2012 года · 28 мин · обновлено 01.10.2026
После урока вы сможете
- Объяснять на деле «Барфут против Эстелла», почему долгосрочный психиатрический прогноз насилия чаще ошибался, чем оказывался верным
- Различать клинический и механический прогноз и пересказывать итог метаанализа Гроува и соавторов: 63, 65 и 8 исследований из 136
- Читать индекс точности и прогностическую ценность и показывать, почему при редком событии инструменты надёжнее выделяют людей низкого риска
- Называть условия, при которых люди без подготовки не уступают алгоритму, по опытам Дрессел и Фарид и Лина и соавторов
- Объяснять, почему спор о предвзятости COMPAS остаётся открытым, хотя у обеих сторон одни и те же числа
Шестого июля 1983 года Верховный суд США вынес решение по делу «Барфут против Эстелла». Спор касался слушания о мере наказания в Техасе, где выступали два психиатра обвинения. Оба отвечали на гипотетические вопросы о подсудимом, то есть на вопросы вида «если человек сделал то и то, опасен ли он». По особому мнению судьи Блэкмана, ни один из них подсудимого не обследовал и не просил об этом. Один психиатр назвал вероятность того, что подсудимый снова совершит насилие, «стопроцентной и абсолютной».
Американская психиатрическая ассоциация подала суду своё заключение как «друг суда», то есть сторона, которая сама в споре не участвует. Ненадёжность долгосрочных прогнозов опасности она назвала установленным в профессии фактом. Лучшая оценка ассоциации: два из трёх таких прогнозов, сделанных психиатрами, ошибочны. Судья Блэкман привёл и вывод исследователя Джона Монахана из книги 1981 года: психиатры и психологи правы не более чем в одном прогнозе насилия из трёх. Эту книгу курс знает только по цитате в особом мнении.
Большинство суда всё же признало такие показания допустимыми. Судья Уайт, писавший мнение большинства, счёл, что состязательный процесс способен отделить надёжное от ненадёжного. Он отметил, что по оценке самой ассоциации психиатры ошибаются не всегда, а «в большинстве случаев». Суд решил и то, что показания о будущей опасности не обязаны опираться на личное обследование.
Отсюда вопрос урока: можно ли предсказать преступление и кто делает это точнее. Исследователи сравнивают два способа соединить одни и те же сведения о человеке. В первом специалист соединяет их в голове, по опыту и впечатлению, и такой прогноз называют клиническим. Во втором сведения складывают по заранее заданному правилу или формуле, одинаково для всех. Такой прогноз называют механическим, статистическим или актуарным.
Формула против специалиста: 63, 65 и 8
В 1954 году психолог Пол Мил собрал в книге около 20 исследований, прямо сравнивших два способа. Саму книгу курс не открывал и знает её по пересказам Мила и соавторов. По пересказу Гроува и Мила, статистический способ ни в одном из них не оказался хуже клинического, хотя формулы часто были далеки от лучших. Одно исследование Мил засчитал клиницистам, но позже выяснилось, что в нём завышены статистические показатели и его стоило считать ничьей.
Ранний пример из этих пересказов относится к 1928 году. Бёрджесс изучил для комиссии по досрочному освобождению штата Иллинойс 3000 освобождённых. Его формула была простой суммой 21 фактора: вид преступления, срок, возраст, число прежних судимостей и другие. Тюремные психиатры чуть точнее формулы предсказывали успех на свободе, но заметно хуже предсказывали неудачи. В 1989 году Доуз, Фауст и Мил насчитали уже около 100 сравнительных исследований. Практически во всех актуарный прогноз сравнялся с клиническим или превзошёл его.
Самый подробный подсчёт сделали Гроув и соавторы в 2000 году. Статистическое объединение результатов многих исследований одного вопроса называют метаанализом. Авторы искали работы о здоровье и поведении человека, где оба прогноза делали для одних и тех же людей. Из 163 найденных исследований в анализ вошли 136. Предсказывали диагноз, исход лечения, успех в учёбе и работе, нарушение условий досрочного освобождения, насилие и рецидив, то есть новое преступление после наказания.
В 63 исследованиях из 136, то есть в 47 %, формула оказалась заметно точнее специалиста. В 65 вышло примерно поровну, и только в 8, или в 6 %, заметно точнее был специалист. В среднем механический прогноз точнее примерно на 10 %. Преимущество не зависело ни от задачи, ни от вида специалистов и их опыта, ни от типа данных. В 7 из 8 исследований, где выиграл специалист, у него было больше сведений, чем у формулы.
Эгисдоттир и соавторы в 2006 году свели 67 исследований за 56 лет, в которых 92 оценки эффекта. Прогнозы специалистов по психическому здоровью в них сравнивали со статистическими. Работа известна курсу по аннотации. Статистические методы вышли в целом несколько точнее, а в самой строгой подвыборке из 48 оценок прирост точности составил 13 %. Числа двух работ легко спутать: 136 исследований у Гроува, 67 у Эгисдоттир.
Почему специалист проигрывает
Сравнивали не опыт с компьютером, а два способа соединить одни и те же данные, и формулой может быть простая сумма баллов на бумаге. Доуз, Фауст и Мил объясняли проигрыш специалиста так. Люди плохо отличают признаки, которые действительно связаны с исходом, от тех, что только кажутся связанными, и находят связи, которых нет.
Кроме того, специалист редко узнаёт, прав ли он был. Консультант, предсказавший насилие, может так и не узнать, чем всё кончилось. Сам прогноз способен повлиять на исход, и тогда проверить его ещё труднее. У Гроува и соавторов нашлась ещё одна подробность: когда у специалиста были данные собеседования с человеком, он проигрывал формуле сильнее.
У вывода две оговорки. Преимущество формулы умеренное: в мере Гроува разница 0,1 соответствует примерно 9-10 процентным пунктам доли верных ответов, а взвешенная средняя разница 0,086. Кроме того, цену ошибок разного рода никто не сравнивал. Напрасно задержанный человек и пропущенный рецидив весят по-разному, а метаанализ считал только точность.
Что умеют инструменты оценки риска
Сегодня прогноз в уголовном правосудии всё чаще делают по инструментам оценки риска, то есть по шкалам со списком факторов. В одних итог считают по формуле, в других специалист идёт по обязательному списку, но вывод делает сам. В 2012 году Фазел и соавторы свели исследования 1995-2010 годов о девяти самых распространённых инструментах. Среди них HCR-20 для прогноза насилия и Static-99 для сексуальных преступлений.
В метаанализ вошли 73 выборки из 13 стран, 24 847 человек. Новое нарушение совершили 5879 из них, то есть 23,7 %, в среднем за 49,6 месяца наблюдения. Главная мера точности здесь та же, что в уроке о полиграфе. Индекс точности, по-английски AUC, показывает, насколько хорошо шкала разводит две группы: 0,5 значит угадывание, 1,0 безошибочность. Для прогноза насилия медиана по 30 выборкам вышла 0,72.
Индекс не говорит, что будет с конкретным человеком, для этого нужны две другие доли. Прогностическая ценность положительного результата показывает, какая часть помеченных «высоким риском» действительно совершила нарушение. Прогностическая ценность отрицательного результата показывает, какая часть помеченных «низким риском» нарушения не совершила. Для насилия медианы вышли 0,41 и 0,91. Словами: из 100 человек, отнесённых к умеренному или высокому риску, насилие совершил в среднем 41, а из 100 отнесённых к низкому риску не совершил 91.
Для сексуальных преступлений разрыв ещё больше, 0,23 против 0,93. Чтобы предотвратить одно нарушение насилия, пришлось бы задержать в среднем двоих отнесённых к риску. Вывод авторов: инструменты хорошо выделяют людей низкого риска, но единственным основанием для задержания, приговора или освобождения служить не могут.
Причина разрыва в базовой частоте, то есть в доле людей с проверяемым признаком среди всех проверяемых. Медианная частота насилия в выборках Фазела 32 %, сексуальных преступлений 16,9 %. Когда событие случается у меньшинства, среди помеченных «высоким риском» нарушителей меньше половины. Когда событие частое, разрыв исчезает: в данных о программе COMPAS, где новый арест за два года был примерно у 45 %, эти доли 0,61 и 0,69. Тот же механизм даёт массу ложных тревог при проверке сотрудников на полиграфе, его подробно разбирает урок 7.
Точность инструмента зависит и от того, кто её проверяет. Сингх, Гранн и Фазел в 2013 году свели 83 исследования, работа известна курсу по аннотации. Если среди авторов был создатель инструмента, показатель точности выходил примерно вдвое выше, чем у независимых авторов. О конфликте интересов не сообщила ни одна из 25 статей с участием создателей или переводчиков инструмента.
Если насильственный рецидив случается у 11 % людей, ответ «никто не совершит» для всех даёт 89 % верных ответов и не находит ни одного нарушителя. Ровно столько же верных ответов у COMPAS в опыте Лина и соавторов 2020 года для насильственного рецидива. Доля верных ответов без базовой частоты, ложных тревог, пропусков и прогностической ценности ничего не говорит о качестве прогноза.
Люди без подготовки против алгоритма
Самый известный инструмент в этих спорах называется COMPAS. Это коммерческая программа компании Northpointe: балл складывается из ответов на 137 вопросов и данных из дел, вопроса о расе среди них нет. В округе Бровард во Флориде её баллами пользовались, решая, отпускать ли человека до суда. В 2016 году редакция ProPublica получила по запросу об открытых записях баллы тысяч подсудимых. Для таблиц ошибок журналисты взяли 7214 человек, за которыми наблюдали два года, и рецидивом считали новый арест. Общая доля верных ответов COMPAS на них, по расчёту курса, 65,4 %.
В 2018 году Дрессел и Фарид проверили, как с той же задачей справятся люди без опыта в уголовном правосудии. Участников от 18 до 74 лет набрали на платформе Amazon Mechanical Turk. Из данных ProPublica случайно взяли 1000 подсудимых и разбили на 20 наборов по 50. Участник читал о человеке короткое описание: пол, возраст, обвинение и его тяжесть, число прежних судимостей. Он решал, совершит ли тот новое нарушение за два года. По описанию Лина и соавторов, после каждого ответа участник узнавал, прав ли он. В основном условии было 400 участников, по 20 на набор.
Среднее медиан по наборам вышло 62,8 %, чуть ниже COMPAS на тех же 1000 подсудимых, 65,2 %, и эта разница статистически значима. Мнение «толпы» из 20 человек по большинству голосов дало 67,0 %, и COMPAS оказался не лучше. Простая формула из двух признаков, возраста и числа прежних судимостей, дала 66,8 %. Вывод авторов: COMPAS не точнее людей без подготовки, а почти всю его точность даёт формула из двух признаков.
В 2020 году Лин, Юнг, Гоэл и Ским повторили и расширили этот опыт: 645 участников, 32 250 ответов, четыре набора данных. Два набора COMPAS были из того же округа: любой рецидив с базовой частотой 48 % и насильственный с частотой 11 %. Участников случайно делили на тех, кто получал немедленную обратную связь, и тех, кто не получал. В условиях исходного опыта результат повторился: люди 64 %, COMPAS 65 %, простая формула авторов, логистическая регрессия, 68 %. Без обратной связи люди дали 62 %.
В остальных трёх наборах алгоритмы были лучше людей. Для насильственного рецидива COMPAS и регрессия дали по 89 % верных ответов, люди с обратной связью 83 %, без неё 60 %. Алгоритмы выигрывали и при более подробных описаниях. По выводу авторов, в условиях ближе к реальным алгоритмы могут превосходить людей. Реальные условия здесь значат отсутствие мгновенной обратной связи, редкое событие и много сведений. Поэтому утверждение, что люди без подготовки предсказывают рецидив так же точно, как алгоритм, сильно ослаблено.
Тренажёр урока показывает обе части этой истории. Сначала на экране столбики метаанализа Гроува и соавторов: 63, 65 и 8 исследований из 136. Потом опыт Лина и соавторов с двумя переключателями: есть ли обратная связь и какое событие предсказывают, любой рецидив с частотой 48 % или насильственный с частотой 11 %. Доли верных ответов людей, COMPAS и регрессии взяты из статьи 2020 года. Доля для ответа «никто не совершит» получена вычитанием базовой частоты. Алгоритмы обратной связи не получают, поэтому их числа от первого переключателя не меняются.
С настоящими судьями алгоритм сравнили Клейнберг и соавторы в 2018 году, работа известна курсу по аннотации и части текста. Они взяли 758 027 дел Нью-Йорка 2008-2013 годов, где судья решал, отпустить ли человека до суда. Алгоритм видел только сведения, доступные судье, без расы, этнической принадлежности и пола. По моделированию авторов, при той же доле оставленных под стражей он мог бы снизить преступность на 14,4-24,7 %.
COMPAS и спор о справедливости
В той же публикации 2016 года ProPublica предъявила COMPAS другую претензию. Среди подсудимых, которые новых нарушений не совершили, «высокий риск» получили 44,85 % чернокожих и 23,45 % белых. Такую долю называют долей ложных тревог. Northpointe ответила числами из тех же данных. Из помеченных «высоким риском» чернокожих нарушений не совершили 37 %, из белых 41 %, а индекс точности в обеих группах 0,69.
Обе стороны посчитали верно, по одной и той же таблице. Калибровкой называют одинаковый смысл одного балла в разных группах. Клейнберг, Муллайнатан и Рагхаван и независимо от них Чулдечова доказали: при разной базовой частоте в группах и неидеальном прогнозе нельзя одновременно уравнять доли ошибок и калибровку. Спор идёт о том, какой критерий считать справедливостью, а не о числах, поэтому у утверждения о предвзятости COMPAS статус «спор открыт». У «толпы» Дрессел и Фарид, которая расу не видела, доля ложных тревог тоже была неравной: 37,1 % у чернокожих против 27,2 % у белых. Подробно спор о справедливости разбирает урок 17 курса «Искусственный интеллект».
Чем может служить такой балл в суде, решал Верховный суд Висконсина 13 июля 2016 года. Он разрешил учитывать балл COMPAS при назначении наказания, но с ограничениями. Баллом нельзя решать, лишать ли человека свободы и насколько строго его наказывать, и он не может быть решающим фактором. В каждом докладе с баллом судье должно стоять письменное предупреждение: методика закрыта как коммерческая тайна, балл описывает группы людей, а не конкретного человека, и инструмент создавался не для приговоров.
Измерено, как часто формулы, шкалы, специалисты и люди без подготовки угадывали исход в больших выборках: у тысяч осуждённых, освобождённых и подсудимых. Отсюда не следует, что человек с высоким баллом совершит новое преступление: из 100 отнесённых к риску насилия его совершил в среднем 41. Не следует и то, что человек с низким баллом безопасен, или что алгоритм сам по себе справедлив. Доля верных ответов и прогностическая ценность описывают группы и зависят от базовой частоты в той выборке, где их посчитали.
Что выдержало
Главный вывод урока выдержал проверку с 1954 года: простая формула прогнозирует поведение людей не хуже опытного специалиста, а часто лучше. Инструменты оценки риска тоже работают, но с перекосом. Они надёжно выделяют людей низкого риска и плохо называют, кто именно совершит насилие.
Отвергнуто утверждение, что специалист может уверенно предсказать насилие конкретного человека. По оценке самих психиатров в 1983 году, два прогноза из трёх ошибались, а сегодняшние инструменты дают медианную прогностическую ценность 0,41. Сильно ослаблено утверждение, что люди без подготовки прогнозируют рецидив не хуже алгоритма: так бывает при частом событии и мгновенной обратной связи. Спор о предвзятости COMPAS открыт, потому что это спор о выборе критерия.
Пределы прогноза нашли не критики со стороны. Сравнения клинического прогноза с формулой собирали сами психологи, начиная с Мила, а ошибки психиатров оценила их собственная ассоциация. Лин и соавторы повторили опыт Дрессел и Фарид и сузили его вывод. Сингх, Гранн и Фазел показали, что создатели инструментов находят у них большую точность, чем независимые авторы.
Формула или человек
Настоящие итоги двух работ: метаанализ 2000 года, где формула против специалиста выиграла в 63 исследованиях из 136 и проиграла в 8, и опыт 2020 года, где люди почти не уступали алгоритму только при обратной связи и частом событии. Учебных чисел нет.
Ключевые исследования
| Гроув, Залд, Лебоу, Сниц и Нельсон | 2000 | Метаанализ 136 исследований из 163 найденных, где клинический и механический прогноз делали для одних и тех же людей: диагноз, исход лечения, учёба и работа, досрочное освобождение, насилие, рецидив. Формула заметно точнее в 63 исследованиях, примерно поровну в 65, специалист точнее в 8. В среднем механический прогноз точнее примерно на 10 %. |
| Доуз, Фауст и Мил | 1989 | Обзор около 100 сравнительных исследований в социальных науках: практически во всех актуарный прогноз сравнялся с клиническим или превзошёл его. Авторы объясняют проигрыш специалиста тем, что люди плохо отличают валидные признаки, видят несуществующие связи и редко узнают, были ли правы. |
| Эгисдоттир и соавторы | 2006 | Метаанализ 67 исследований за 56 лет, 92 оценки эффекта, известный курсу по аннотации. Прогнозы специалистов по психическому здоровью против статистических: статистические несколько точнее, в самой строгой подвыборке из 48 оценок прирост точности 13 %. |
| Фазел, Сингх, Долл и Гранн | 2012 | Систематический обзор и метаанализ исследований 1995-2010 годов о девяти инструментах оценки риска: 73 выборки, 24 847 человек из 13 стран. Для насилия медианный индекс точности 0,72, прогностическая ценность положительного результата 0,41, отрицательного 0,91. |
| Дрессел и Фарид | 2018 | Опыт на участниках платформы Amazon Mechanical Turk: 400 человек в основном условии оценивали по коротким описаниям 1000 подсудимых из данных ProPublica в 20 наборах по 50, с обратной связью после каждого ответа. Среднее медиан по наборам 62,8 %, «толпа» из 20 человек 67,0 %, COMPAS 65,2 %, формула из двух признаков 66,8 %. |
| Лин, Юнг, Гоэл и Ским | 2020 | Повторение и расширение опыта Дрессел и Фарид: 645 участников, 32 250 ответов, четыре набора данных, случайное деление на получавших и не получавших обратную связь. В исходных условиях люди 64 %, COMPAS 65 %. Для насильственного рецидива с частотой 11 % алгоритмы 89 %, люди без обратной связи 60 %. |
| Клейнберг, Лаккараджу, Лесковец, Людвиг и Муллайнатан | 2018 | Сравнение алгоритма с решениями судей Нью-Йорка по 758 027 делам 2008-2013 годов, известное курсу по аннотации и части текста. Алгоритм видел только сведения, доступные судье. По моделированию, при той же доле оставленных под стражей он мог бы снизить преступность на 14,4-24,7 %. |
Что подтвердилось, а что нет
Мил 1954 года, около 20 сравнений по пересказам, Доуз, Фауст и Мил 1989 года, около 100 исследований, метаанализ Гроува и соавторов 2000 года: из 136 исследований 63 в пользу формулы, 65 поровну, 8 в пользу специалиста. Эгисдоттир и соавторы 2006 года, 67 исследований, известные курсу по аннотации: прирост точности 13 % в строгой подвыборке. Оговорка: преимущество умеренное, в среднем около 10 %, а цену разных ошибок не сравнивали.
По оценке Американской психиатрической ассоциации в деле «Барфут против Эстелла» 1983 года, два из трёх долгосрочных психиатрических прогнозов насилия ошибочны. Даже структурированные инструменты сегодня дают медианную прогностическую ценность положительного результата 0,41: из отнесённых к риску насилие совершают меньше половины (Фазел и соавторы 2012).
Фазел и соавторы 2012 года, 73 выборки из 13 стран и девять инструментов: для насилия прогностическая ценность отрицательного результата 0,91 против 0,41 положительного, для сексуальных преступлений 0,93 против 0,23. Оговорка: это прямое следствие того, что событие случается у меньшинства. Когда событие частое, разрыв исчезает: в данных ProPublica при частоте около 45 % доли 0,69 и 0,61.
Дрессел и Фарид 2018 года: при мгновенной обратной связи и частом событии «толпа» дала 67,0 % против 65,2 % у COMPAS, а отдельный участник чуть хуже, 62,8 % по медианам наборов. Лин и соавторы 2020 года повторили это, но без обратной связи, при редком событии и подробных описаниях люди заметно проигрывали: для насильственного рецидива 60 % против 89 %. Клейнберг и соавторы 2018 года: алгоритм лучше реальных судей Нью-Йорка.
Термины
- клинический прогнозclinical prediction
- Прогноз, в котором специалист соединяет сведения о человеке в голове, по опыту и впечатлению.
- механический прогнозmechanical, statistical, actuarial prediction
- Прогноз, в котором сведения о человеке соединяют по заранее заданному правилу или формуле, одинаково для всех. Его называют также статистическим или актуарным.
- метаанализmeta-analysis
- Статистическое объединение результатов многих исследований одного вопроса.
- базовая частотаbase rate
- Доля людей с проверяемым признаком, например нарушителей, среди всех проверяемых до любой проверки. При редком признаке даже точный тест даёт много ложных тревог.
- индекс точностиaccuracy index A, area under the ROC curve
- Мера того, насколько хорошо тест разводит две группы при любых порогах: 0,5 означает угадывание, 1,0 безошибочность. Не равен доле верных ответов.
- прогностическая ценность положительного результатаpositive predictive value, PPV
- Доля тех, кто действительно совершил нарушение, среди помеченных «высоким риском». Сильно зависит от базовой частоты.
- прогностическая ценность отрицательного результатаnegative predictive value, NPV
- Доля не совершивших нарушения среди помеченных «низким риском».
- доля ложных тревогfalse positive rate
- Доля помеченных «высоким риском» среди тех, кто нарушений не совершил.
- калибровкаcalibration
- Свойство прогноза, при котором одинаковый балл означает одинаковую долю нарушителей в разных группах.
Практикум · Разбор текста о прогнозе преступлений
Новости об алгоритмах, которые «предсказывают преступления», реклама инструментов оценки риска и статьи об экспертах, видящих опасного человека насквозь, часто называют точность одним числом. Задание: разобрать один такой текст вопросами урока. Понадобится только сам текст.
- Найдите новость, статью или рекламу, где говорится о прогнозе преступлений или рецидива программой, шкалой или специалистом. Сохраните текст и выпишите все числа о точности вместе с фразами, в которых они стоят.
- Для каждого числа определите, что это: доля верных ответов, индекс точности, прогностическая ценность или «точность» без пояснения. Отметьте, названа ли базовая частота события в той выборке, где число получено.
- Если названа только доля верных ответов, сравните её с ответом «никто не совершит» для всех, то есть со 100 % минус базовая частота. Если базовой частоты в тексте нет, отметьте, что сравнить не с чем.
- Определите, с чем сравнивали прогноз: с угадыванием, с людьми без подготовки, со специалистами или с простой формулой из двух признаков. Отметьте, кто проверял инструмент: его создатели или независимые авторы.
- Поставьте главному утверждению текста статус из реестра урока. Отдельно отметьте, не переносит ли текст число, посчитанное по группе, на конкретного человека.
Вопросы для самопроверки
Какую оценку долгосрочных психиатрических прогнозов насилия Американская психиатрическая ассоциация дала суду в деле «Барфут против Эстелла» 1983 года?
- Два прогноза из трёх ошибочны
- Ошибается около одного прогноза из десяти, если психиатр лично обследовал подсудимого
- Прогноз верен примерно в половине случаев, то есть не лучше подброшенной монеты
- Опытный психиатр почти не ошибается, а ошибки дают специалисты без подготовки
Что показал метаанализ Гроува и соавторов 2000 года по 136 исследованиям?
- Опытный специалист обычно точнее формулы, а формула выигрывает только у новичков
- Формула выигрывает в медицине, а в прогнозе насилия и рецидива специалист точнее
- Способы примерно равны, если специалист лично беседовал с человеком
- Формула заметно точнее в 63 исследованиях, поровну в 65, специалист точнее в 8
По метаанализу Фазела и соавторов 2012 года медианная прогностическая ценность положительного результата для насилия 0,41. Что это значит?
- Из 100 человек, отнесённых к риску насилия, насилие совершил в среднем 41
- Инструмент верно оценивает 41 человека из 100, то есть работает хуже угадывания
- Инструмент ошибается в 41 случае из 100, но только у людей низкого риска
- 41 % насильственных преступлений совершили люди, которых инструмент не заметил
В каких условиях опыта Лина и соавторов 2020 года люди без подготовки почти сравнялись с COMPAS?
- Когда описания подсудимых были подробными: чем больше сведений, тем ближе люди к алгоритму
- Когда предсказывали редкое событие, насильственный рецидив, потому что его легче заметить
- Когда участников было больше шестисот, а решения принимали по большинству голосов
- При частом событии и обратной связи после каждого ответа
ProPublica и Northpointe по одной таблице пришли к разным выводам о COMPAS. Почему спор остаётся открытым?
- ProPublica ошиблась в подсчёте ложных тревог, и компания показала верные числа
- Компания не раскрыла данные, и проверить её расчёт по другим источникам невозможно
- При разной базовой частоте в группах нельзя одновременно уравнять доли ошибок и калибровку
- Спор разрешится, если убрать из вопросов программы сведения о расе подсудимых
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Grove, Zald, Lebow, Snitz, Nelson, 2000. Clinical versus mechanical prediction: A meta-analysis. Psychological Assessment, 12(1), 19-30. Копия на сайте лаборатории: https://zaldlab.psy.vanderbilt.edu/resources/wmg00pa.pdf: Раздел Results с делением 63, 65 и 8 исследований и раздел Discussion о том, от чего преимущество формулы не зависит.
- Fazel, Singh, Doll, Grann, 2012. Use of risk assessment instruments to predict violence and antisocial behaviour in 73 samples involving 24 827 people. BMJ, 345, e4692. Открытый доступ: https://pmc.ncbi.nlm.nih.gov/articles/PMC3404183/: Таблица 3 с индексом точности и прогностической ценностью по трём типам инструментов и абзац о том, скольких пришлось бы задержать ради одного предотвращённого нарушения. В заголовке 24 827 человек, в тексте 24 847.
- Dressel, Farid, 2018. The accuracy, fairness, and limits of predicting recidivism. Science Advances, 4(1), eaao5580. Открытый доступ: https://pmc.ncbi.nlm.nih.gov/articles/PMC5777393/: Таблицы 1 и 2: люди без подготовки против COMPAS и формула из двух признаков.
- Lin, Jung, Goel, Skeem, 2020. The limits of human predictions of recidivism. Science Advances, 6(7), eaaz0652. Открытый доступ: https://pmc.ncbi.nlm.nih.gov/articles/PMC7021503/: Таблица 1 с четырьмя наборами данных и рисунок 2 с точностью людей при обратной связи и без неё.
- Angwin, Larson, Mattu, Kirchner, 2016. How We Analyzed the COMPAS Recidivism Algorithm. ProPublica: https://www.propublica.org/article/how-we-analyzed-the-compas-recidivism-algorithm: Методика расследования и таблицы 2×2 для всех, для чернокожих и для белых подсудимых, по которым считали обе стороны спора.