К содержанию
Фонтум Искусственный интеллект Урок 17 / 24 Все уроки

Главная · Курсы · Искусственный интеллект · Программа курса · Модуль VI. Что идёт не так · урок 17 из 24

Предвзятость искусственного интеллекта: дело COMPAS

Почему в споре о COMPAS обе стороны считали правильно

Предвзятость искусственного интеллекта это устойчивое различие в решениях модели для разных групп людей, пришедшее из данных, а не из чьего-то намерения. Инструмент отбора резюме в Amazon понижал резюме со словом «женский», потому что учился на кадровых решениях прошлых лет, и в 2018 году проект закрыли. В споре о системе COMPAS обе стороны считали верно: при разной базовой частоте калибровка и равенство долей ошибок несовместимы, это доказано в 2016 году.

ProPublica о COMPAS, 2016. Клейнберг, Муллайнатан и Рагхаван, 2016. Чулдечова, 2016. Amazon, 2018 · 24 мин · обновлено 01.10.2026

После урока вы сможете

  • Объяснять, откуда предвзятость попадает в модель, если её туда никто не закладывал
  • Разбирать спор о COMPAS как спор о значении слова «справедливость», а не о числах
  • Знать, что несколько естественных определений справедливости доказано несовместимы
  • Видеть ценностный выбор там, где он спрятан в пороге и в выборе меры

В 2018 году стало известно, что Amazon свернул внутренний инструмент отбора резюме. Программа оценивала кандидатов звёздами, как товары в магазине, и должна была экономить время кадровикам. Проработала она недолго: выяснилось, что резюме со словом «женский» инструмент систематически понижал.

Под понижение попадали «капитан женской шахматной команды» и «выпускница женского колледжа». Правила «отсеивать женщин» никто не писал, и такого пункта в программе не было. Инструмент учился на кадровых решениях компании за прошлые годы, а в этих решениях мужчин нанимали чаще. Модель добросовестно нашла закономерность и стала её продолжать.

Заметьте, что программа не сломалась. Она сделала ровно то, чему её учили: нашла в данных устойчивую связь и применила её к новым случаям. Проект закрыли, но вопрос остался, и он шире одной компании. Этот урок о том, почему такое происходит системно, и почему починить это труднее, чем кажется.

Откуда берётся предвзятость, если её никто не закладывал

Предвзятость модели это устойчивое различие в её решениях или в качестве работы для разных групп людей. Берётся оно из данных, а не из чьего-то намерения. Слово сбивает с толку: в обычной речи оно означает пристрастность человека, а здесь никакой пристрастности нет. Есть арифметика, аккуратно повторяющая то, что было в примерах.

Механизм из урока 2 работает здесь буквально. Модель не получает правил, она получает примеры и ищет в них закономерности. Данные при этом почти никогда не описывают устройство мира: они описывают прошлые решения людей. Кого наняли, кому одобрили кредит, кого задержали повторно, всё это записи поведения, со всеми его особенностями.

Отсюда простое, но неприятное следствие. Если в прошлых решениях была систематическая разница, модель выучит её как полезный признак. Она не отличает «так справедливо» от «так было»: для функции потерь это одно и то же число. Улучшая предсказание, модель будет усиливать закономерность, а не исправлять её.

Первое, что приходит в голову, это убрать чувствительный признак из данных. Приём помогает слабее, чем ожидается, потому что информация остаётся в других колонках. Почтовый индекс, название школы, набор увлечений, обороты речи в тексте, всё это связано с полом, возрастом и происхождением. Такие косвенные признаки называют прокси-признаками, и вычистить их полностью обычно не выходит.

У предвзятости есть и второй источник, попроще. Если примеров одной группы в обучении заметно меньше, модель на этой группе просто чаще ошибается. Никакой несправедливости тут никто не задумывал, а результат получается тот же: качество распределено неровно. Проверяется это так же, измерением по каждой группе отдельно, а не в среднем.

Это не значит, что убирать признак бессмысленно. Значит только, что одной этой мерой дело не закрывается. Проверять всё равно придётся результат, а не намерение, и проверка результата это разбивка ошибок по группам. Дальше урок занят именно ею.

COMPAS: что нашла ProPublica

Самым разобранным случаем в этой области стал COMPAS, инструмент оценки риска повторного нарушения. Его баллами пользовались суды в США: балл подсказывал, насколько вероятно, что человек снова окажется в суде. В 2016 году редакция ProPublica проверила эти предсказания, сопоставив их с тем, что произошло дальше на самом деле.

Сравнивать было с чем: по каждому человеку известны и балл, и последующая судьба. Журналисты смотрели не на общую точность, а на структуру ошибок, на то, кого именно система записала не в ту сторону. Разница между расовыми группами оказалась заметной, и у разных ошибок она шла в разные стороны.

Среди тех, кто новых нарушений не совершил, чернокожих подсудимых чаще помечали как высокий риск. Среди тех, кто нарушение совершил, белых подсудимых чаще помечали как низкий риск. То есть одна группа чаще получала напрасную метку, а другая чаще проходила незамеченной. Публикация вызвала громкий спор, и устроен этот спор оказался интереснее, чем ожидали обе стороны.

Что ответила компания

Northpointe, разработчик COMPAS, возразила по существу и с числами в руках. Довод был такой: алгоритм одинаково откалиброван для обеих групп. Это значит, что при одном и том же балле доля людей, у которых событие действительно произошло, в группах совпадает.

Требование разумное, и его легко объяснить на пальцах. Если балл «семь из десяти» означает для одной группы 60 человек из ста, а для другой 40 из ста, то балл нельзя читать. Одна и та же цифра значила бы разное в зависимости от того, кто перед вами. Калибровка как раз и запрещает такое расхождение.

Проверка показала, что калибровка соблюдалась. И вот главное, ради чего рассказан весь сюжет: оба утверждения верны одновременно. ProPublica считала правильно, компания считала правильно, а числа при этом были одни и те же. Это не тот случай, когда кто-то подтасовал данные или выбрал удобную выборку.

Считаем руками

Чтобы увидеть механизм, возьмём выдуманные, но арифметически честные числа: две группы по тысяче человек в каждой. В группе A новое нарушение совершат 300 человек, а в группе B таких окажется 450. Эта доля называется базовой частотой события, и у двух групп она разная.

Система помечает часть людей как «высокий риск». В группе A она пометила 250 человек: 150 из них нарушение совершат, а 100 обойдутся без него. В группе B она пометила 450 человек: нарушение совершат 270, а 180 обойдутся без него. Дальше нам понадобятся только эти шесть чисел.

Посчитаем оправданность метки, то есть долю тех, кто действительно совершит, среди помеченных. В группе A это 150 из 250, то есть 60 из ста. В группе B это 270 из 450, и снова ровно 60 из ста. Калибровка соблюдена: метка означает в обеих группах одно и то же.

Теперь возьмём ложные тревоги, долю помеченных среди тех, кто ничего не совершит. В группе A таких людей 700, напрасно помечены 100, то есть около 14 из ста. В группе B таких людей 550, напрасно помечены 180, то есть около 33 из ста. Разрыв больше чем вдвое, и появился он сам, без единого упоминания группы внутри модели.

Третьей величиной остаются пропуски, доля непомеченных среди тех, кто нарушение совершит. В группе A пропущены 150 из 300, ровно половина. В группе B пропущены 180 из 450, то есть 40 из ста. Здесь разрыв идёт в обратную сторону: одна группа чаще получает напрасную метку, другая чаще остаётся незамеченной.

Стоит понять, откуда взялся разрыв, ведь он не случайность и не особенность выдуманных чисел. В группе B событие происходит чаще, поэтому при той же оправданности метки система помечает там больше людей. А тех, у кого события не будет, в группе B меньше: их 550 против 700. Больше меток при меньшем знаменателе и даёт ту самую долю ложных тревог.

Ни одно из трёх чисел не подтасовано, все три посчитаны по одной и той же таблице. Спор о COMPAS был устроен именно так: одна сторона смотрела на ложные тревоги, другая на оправданность метки. Обе видели правду, и обе видели не всю.

мерагруппа Aгруппа Bитогоправданность метки60 из 10060 из 100сошлосьложная тревога14 из 10033 из 100разрывпропуск50 из 10040 из 100разрывбазовая частота события30 из 10045 из 100одна модель, один порог, две группы: три разных ответа о справедливости
Одна таблица, три меры: калибровка сошлась, обе доли ошибок разъехались
ловушка«Точность 90 %» не отвечает ни на один нужный вопрос

Общая доля верных ответов складывает вместе ложные тревоги и пропуски, а потом усредняет по всем группам сразу. Из неё нельзя узнать ни того, кому достаются напрасные метки, ни того, кого пропускают. Две системы с одинаковой точностью могут распределять ошибки прямо противоположным образом. Спрашивать надо разбивку, а не среднее.

Три определения, и все три разумные

Разложим посчитанное на вопросы, которые за ним стоят. Первый: означает ли метка одно и то же для всех, это и есть калибровка. Второй: одинаков ли риск получить метку зря. Третий: одинаков ли риск, что опасный случай пропустят.

У каждого вопроса есть тот, кому он важнее прочих. Калибровка нужна судье, который читает балл и должен понимать, что означает цифра. Равенство ложных тревог нужно человеку, который ничего не совершит и не хочет получить метку напрасно. Равенство пропусков нужно тем, кого затронет невыявленный случай.

Три меры взяты не с потолка, но и не исчерпывают список. Формальных определений справедливости предложено заметно больше трёх, и некоторые из них противоречат друг другу попарно. Для урока важно не их число, а устройство: каждое определение это ответ на вопрос, что мы обещаем человеку, и обещания у них разные.

Ни одно из трёх требований не выглядит придиркой, и ни одно не жульничает. Именно поэтому спор о COMPAS не был спором о фактах. Он был спором о том, какое из требований называть справедливостью, а такой спор числами не решается.

Доказанная несовместимость

В том же 2016 году появился результат, закрывший надежду помирить эти требования. Джон Клейнберг, Сендхил Муллайнатан и Маниш Рагхаван, а независимо от них Александра Чулдечова (Alexandra Chouldechova), доказали одно и то же. При разной базовой частоте события такие определения справедливости не могут выполняться одновременно.

Доказательство не про COMPAS и не про конкретную модель. Оно про арифметику любой системы, которая делит людей на две корзины, включая человека с блокнотом. Если базовые частоты в группах различаются, а предсказание не идеально, выполнить все три условия сразу невозможно. Не «трудно», не «пока не научились», а невозможно.

Оговорки у результата есть, и они важны. Условия совместимы в двух случаях: когда базовые частоты совпадают или когда предсказание безошибочно. Первое иногда достижимо вмешательством в мир, а не в код. Второе не встречается нигде.

Отсюда вывод, ради которого написан урок. Выбор между определениями справедливости ценностный, а не технический. Спрятать его внутрь кода не получится: код всё равно выберет, просто молча и без объяснений. Разница только в том, назовёт кто-нибудь этот выбор вслух или не назовёт.

миф«Алгоритм объективен, потому что это математика»

Сами вычисления действительно не имеют предпочтений, и на этом объективность заканчивается. Данные выбирает человек, и это записи прошлых решений. Цель обучения формулирует человек. Порог ставит человек, а вместе с порогом выбирает, какая ошибка будет чаще. Математика лишь исполняет выбор в точности и без спора, и это не то же самое, что беспристрастность.

Откуда берётся разница в базовых частотах

Теорема начинается словами «если базовые частоты различаются», и стоит спросить, откуда они берутся. Базовая частота не свойство группы, а результат измерения. Меряется она тем же миром и теми же людьми, чьи решения потом попадают в обучение.

В данных о рецидиве, например, записаны повторные задержания, а не все совершённые нарушения. Задержание зависит от того, где и как работает полиция, а не только от поступка. Значит, часть разницы между группами может быть разницей в наблюдении, а не в поведении.

Практический вывод простой и полезный. Прежде чем спорить о справедливости порога, стоит спросить, что именно посчитано в базовой частоте. Иногда починить измерение важнее и честнее, чем спорить о том, куда сдвинуть ручку.

Порог это и есть выбор

Проще всего увидеть выбор на пороге. Модель обычно выдаёт не решение, а число: оценку риска где-то между нулём и единицей. Решение появляется, когда кто-то говорит: выше такой-то отметки помечаем, ниже не помечаем. Эта отметка и называется порогом.

Ручка порога двигается плавно, и последствия у неё зеркальные. Опустишь порог, поймаешь больше настоящих случаев и заодно пометишь зря больше людей. Поднимешь, напрасных меток станет меньше, зато больше случаев пройдёт мимо. Правильного положения у ручки нет. Есть ответ на вопрос, какая из двух ошибок дороже.

Ответ зависит от того, что стоит за меткой. Если метка означает дополнительную проверку у врача, ложная тревога стоит недорого, а пропуск может стоить жизни. Если метка означает отказ в залоге, ценой ложной тревоги становятся месяцы в изоляторе для невиновного. Арифметика одна и та же, а ответы разные.

Тренажёр к уроку даёт эту ручку в руки. Две группы с разной базовой частотой, три строки со сравнением ошибок и один порог на всех. Закройте разрыв в двух строках, третья разъедется, и так будет каждый раз. Это не недоработка тренажёра, а та самая теорема, потроганная руками.

на заметкуЧто попробовать в тренажёре

Сначала поставьте порог так, чтобы сошлись ложные тревоги, и посмотрите на оправданность метки. Потом добейтесь равной оправданности и посмотрите на пропуски. Полезно проделать это трижды подряд: рука сама начинает искать положение, которого нет, и именно в этот момент теорема перестаёт быть абстракцией.

Что из этого не следует

Легко сделать вывод, что алгоритмам в таких решениях не место. Вывод соблазнительный, но из сказанного он не следует. Человек, принимающий те же решения, подчиняется той же арифметике: базовые частоты у него те же, а предсказание тоже не безошибочно. Разница в том, что у человека выбор нигде не записан и меняется от настроения и от усталости.

Есть и обратная ошибка, встречающаяся чаще. Из того, что решение считает программа, делают вывод о его беспристрастности. «Это же математика, у неё нет предрассудков». Фраза звучит убедительно и означает не то, что кажется. Беспристрастна арифметика. Беспристрастны ли данные, цель и порог, это отдельные вопросы, и отвечает на них человек.

Полезнее спрашивать конкретное, и вопросов всего четыре. На каких данных обучена система и чьи решения в этих данных записаны. Какое определение справедливости выбрано и почему выбрано именно оно. Как выглядит разбивка ошибок по группам, и кто отвечает, если метка оказалась ложной.

Ни один из четырёх вопросов не требует знания математики. Все четыре требуют, чтобы кто-то назвал сделанный выбор словами. Это посильное требование к любой системе, которая сортирует людей.

Что дальше

Урок начался с инструмента, выучившего у компании то, чего компания передавать не собиралась. Кончается он результатом, из которого следует, что идеально справедливого порога не существует. Между этими двумя точками нет ни одного места, где виновата была бы техника.

Следующий урок о поломке другого рода, где виновата как раз конструкция. Модель получает инструкции и данные одним потоком текста и не имеет надёжного способа их различить. Пока модель только отвечает, это неприятно. Когда она получает право действовать, это становится дырой.

А урок 19 покажет, что происходит, когда всё описанное встречается с законом. Там же выяснится, почему сроки европейского регламента об ИИ пришлось сдвигать. Обе истории про одно: техника опережает договорённости о том, как ею пользоваться.

тренажёр урока 17

Порог, который нельзя выбрать правильно

Одна ручка, две группы с разной базовой частотой события и три определения справедливости. Закройте разрыв в двух строках, и третья разъедется. Это доказанная невозможность, а не недоработка.

Открыть тренажёр

Ключевые работы и результаты

ProPublica, расследование о COMPAS2016Баллы риска сопоставлены с тем, что произошло с людьми дальше. Показана разница в структуре ошибок между расовыми группами: у одной чаще случались напрасные метки, а у другой пропуски.
Клейнберг, Муллайнатан и Рагхаван, а независимо от них Чулдечова2016Доказано, что при разной базовой частоте события и неидеальном предсказании калибровка и равенство долей ошибок не выполняются одновременно. Результат математический и не зависит от устройства модели.
Amazon, внутренний инструмент отбора резюме2018Инструмент понижал резюме со словом «женский», потому что обучался на кадровых решениях компании за прошлые годы. Проект закрыли.

Что подтвердилось, а что нет

мифАлгоритм объективен, потому что это математика.

Вычисления действительно не имеют предпочтений, но выбор данных, цели и порога делает человек. В данных записаны прошлые решения, и модель воспроизводит их закономерности, включая те, которые никто не собирался передавать. Инструмент Amazon понижал резюме со словом «женский» без единой строки о поле в правилах.

отвергнутоЕсли постараться, алгоритм можно сделать справедливым сразу по всем разумным определениям.

В 2016 году это доказано невозможным: Клейнберг, Муллайнатан и Рагхаван, а независимо от них Чулдечова, показали, что при разной базовой частоте события и неидеальном предсказании такие определения несовместимы. Исключений ровно два, и оба вне практики: равные базовые частоты и безошибочное предсказание. Выбор между определениями остаётся ценностным.

сильно ослабленоДостаточно убрать из данных пол и расу, и предвзятости не будет.

Информация остаётся в связанных признаках: почтовом индексе, названии школы, наборе увлечений, оборотах речи. Модель восстанавливает по ним то, что убрали, и делает это тем охотнее, чем сильнее связь помогает предсказанию. Мера не бесполезна, но как единственная не работает: проверять приходится результат, разбивку ошибок по группам.

выдержалоПри разной базовой частоте события несколько естественных определений справедливости не могут выполняться одновременно.

Это доказано, а не измерено, и потому не устареет: Клейнберг, Муллайнатан и Рагхаван, а независимо от них Чулдечова показали в 2016 году, что калибровка и равенство долей ошибок между группами несовместимы, если базовые частоты различаются, а предсказание не идеально. Результат не зависит ни от устройства модели, ни от данных, ни от намерений разработчика: заменой алгоритма он не обходится. Что из него следует, стоит сказать точно. Он не говорит, какое определение справедливости верное, и выбирать не запрещает. Зато он лишает выбор возможности спрятаться в коде. Спор о системе COMPAS был спором не о числах: обе стороны считали правильно и называли справедливостью разное.

Термины

предвзятость моделиalgorithmic bias
Устойчивое различие в решениях или в качестве работы модели для разных групп людей, возникшее из данных, а не из чьего-то намерения.
прокси-признакproxy variable
Признак, косвенно несущий информацию о другом, убранном признаке: почтовый индекс, название школы, обороты речи. Из-за прокси удаление чувствительной колонки не устраняет различие.
базовая частотаbase rate
Доля людей в группе, у которых событие действительно происходит. Величина измеренная, а не данная: зависит от того, что и как считали.
порогdecision threshold
Отметка на шкале оценки, выше которой случай помечают. Сдвиг порога меняет соотношение двух ошибок, но не устраняет их обе.
ложная тревогаfalse positive
Метка, поставленная тому, у кого событие не произойдёт. Считается долей среди тех, кто события не даст.
пропускfalse negative
Отсутствие метки у того, у кого событие произойдёт. Считается долей среди тех, у кого событие случится.
калибровкаcalibration
Свойство оценки, при котором одинаковый балл означает одинаковую долю случившихся событий во всех группах. Довод, которым Northpointe отвечала на расследование о COMPAS.
несовместимость определений справедливостиimpossibility of fairness
Доказанный в 2016 году результат: при разной базовой частоте и неидеальном предсказании калибровка и равенство долей ошибок не выполняются одновременно.

Практикум · Разбор одной системы, которая сортирует людей

Навык этого урока состоит в том, чтобы доставать спрятанный ценностный выбор наружу и называть его словами. Тренируется он на конкретной системе, а не на рассуждениях вообще. Годится любая, о которой вы можете что-то узнать.

  1. Выберите систему, которая делит людей на две корзины: скоринг банка, отбор резюме, очередь на проверку, автоматическая модерация. Запишите одной фразой, что происходит с человеком после метки.
  2. Опишите обе ошибки словами вашей задачи. Что означает напрасная метка и кто за неё платит. Что означает пропуск и кто платит за него. Пишите про людей, а не про проценты.
  3. Решите, какая из двух ошибок в этой задаче дороже, и запишите ответ одной фразой. Это и есть выбор определения справедливости, сделанный вслух и вами.
  4. Выясните, на каких данных система обучена и чьи решения в них записаны. Если это записи прошлых решений людей, перечислите, какие особенности этих решений модель выучит заодно с полезным.
  5. Откройте тренажёр урока и попробуйте закрыть все три разрыва сразу. Когда не выйдет в третий раз, вернитесь к пункту с ответом и проверьте, готовы ли вы отстаивать его вслух.

Вопросы для самопроверки

Вопрос 1

Инструмент отбора резюме понижал заявки со словом «женский», хотя правила «отсеивать женщин» в программе не было. Как это вышло?

  • В код закралась ошибка, которую не заметили при проверке
  • Модель обучали на текстах из интернета, и перекос пришёл оттуда, а не из данных компании
  • Данные компании: модель училась на прошлых кадровых решениях и выучила закономерность, которая в них была
  • Слово «женский» встречалось в резюме слишком редко, и модель отнесла такие заявки к неразобранным
Вопрос 2

ProPublica и компания Northpointe разошлись в оценке COMPAS. Что было верно?

  • Оба утверждения верны: стороны опирались на разные меры справедливости
  • ProPublica ошиблась в расчётах: доли ложных тревог у групп на деле совпадали, и компания это показала
  • Компания подтасовала данные, чтобы скрыть разницу
  • Спор решается, если посчитать общую точность алгоритма по обеим группам сразу и сравнить её с человеческой
Вопрос 3

Что именно доказали Клейнберг с соавторами и Чулдечова в 2016 году?

  • Что алгоритмы предвзяты по своей природе: любое статистическое правило неизбежно ухудшает положение меньшинства
  • Что COMPAS работал хуже человека
  • Что предвзятость исчезает, если убрать признак расы: вместе с ним уходят и все связанные сведения
  • Что при разной базовой частоте события несколько естественных определений справедливости несовместимы
Вопрос 4

Порог классификатора опустили ниже. Что произойдёт с ошибками?

  • Вырастут и ложные тревоги, и пропуски
  • Ложных тревог станет больше, пропусков меньше
  • Обе ошибки уменьшатся, если модель хороша
  • Ничего не изменится: порог влияет только на скорость работы
Вопрос 5

«Программа не может быть предвзятой, ведь это математика». Что не так с доводом?

  • Математика на самом деле тоже бывает неточной: округления и погрешности вносят собственный перекос
  • Смотря какой алгоритм: у одних перекоса нет, у других есть
  • Беспристрастна арифметика, а данные, цель и порог выбирает человек
  • Предвзятость бывает только у моделей, обученных на текстах: числовые данные такого перекоса не несут

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Julia Angwin и соавторы, «Machine Bias», ProPublica, 2016: Само расследование, с описанием методики в приложении. Читать полезно вместе с ответом компании: видно, как две правильные арифметики расходятся.
  • Jon Kleinberg, Sendhil Mullainathan, Manish Raghavan, «Inherent Trade-Offs in the Fair Determination of Risk Scores», 2016: Та самая теорема. Формулировки строгие, но вводная часть читается без математики и объясняет, почему выбор неизбежен.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Искусственный интеллект»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?