Как мозг распознаёт объекты
Один предмет даёт неограниченно много изображений. Чем измерена трудность и чего стоит инвариантность
Узнавание предмета требует двух противоположных свойств сразу: описание должно быть инвариантным к сдвигу, повороту, размеру, освещению и частичному закрытию и при этом различающим. Трудность в том, что два изображения одного стула бывают непохожи сильнее, чем изображения стула и чемодана. Ди Карло, Дзокколан и Раст (2012) описали задачу геометрически: вдоль вентрального маршрута многообразия объектов распутываются.
MIT 9.13 · DiCarlo, Zoccolan & Rust, 2012 · Rajalingham и др., 2018 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Формулировать узнавание как требование инвариантности и различения одновременно и объяснять, почему поиск похожего эту задачу не решает
- Излагать гипотезу о распутывании многообразий в проверяемом виде и называть наблюдение, которое её опровергло бы
- Читать слепоту к изменениям как ограничение на удержанное, не подменяя её выводом об отсутствии репрезентаций
- Разделять совпадение результата и совпадение механизма при сравнении с искусственными системами
Возьмите стул. Каждый раз, когда вы на него смотрите, на сетчатке оказывается другое распределение яркостей: другое расстояние, другой угол, другой свет, часть закрыта столом, часть сливается с фоном. Множество изображений, которые может дать один этот стул, ничем не ограничено.
И это ещё не главная трудность. Главная в том, что два изображения одного стула бывают непохожи сильнее, чем изображение стула и изображение чемодана. По любой мере сходства, которую можно посчитать прямо на яркостях, близость не совпадает с принадлежностью к предмету. Значит, узнавание не сводится к поиску похожего.
При этом задача решается быстро. Торп, Физ и Марло (1996) показывали новые фотографии по 20 миллисекунд и просили ответить, есть ли на снимке животное. Различие в электрической активности лба между пробами с ответом и без ответа развивалось примерно через 150 миллисекунд после начала стимула. Значит, обработки, достаточной для решения, хватает этого срока. Урок о том, почему это трудно, чем трудность измерена и что известно про её преодоление.
Почему шаблон не работает
Наивное решение хранить образец и сравнивать с ним ломается дважды. Во-первых, образцов нужно столько, сколько бывает видов одного предмета, то есть неограниченно много. Во-вторых, даже при неограниченном хранилище сравнение надо на чём-то делать, а на уровне яркостей похожесть не отслеживает тождество предмета.
Точная постановка получается, если развести два требования, тянущие в разные стороны. Описание должно быть инвариантным (invariance): не меняться при сдвиге, повороте, изменении размера, освещения, частичном закрытии. И оно же должно быть различающим: не сливать разные предметы. Каждое требование по отдельности выполняется тривиально. Константа инвариантна и бесполезна, а само изображение различает всё и не инвариантно ни к чему. Трудность в том, чтобы выполнить оба сразу.
Отсюда видно, почему у этой задачи нет решения «в лоб» и почему на неё уходит целая иерархия областей. Каждая ступень немного увеличивает инвариантность, теряя как можно меньше различающей силы. Это работа, а не пересылка.
Распутывание многообразий
Ди Карло, Дзокколан и Раст (2012) предложили формулировку, которая переводит сказанное в проверяемую форму. Пусть записана активность популяции нейронов. Каждое изображение задаёт точку в пространстве, размерность которого равна числу нейронов. Все изображения одного предмета, при всех сдвигах, поворотах и освещениях, образуют в этом пространстве поверхность, которую называют многообразием объекта (object manifold).
Задача формулируется геометрически. У входа и в ранних областях многообразия разных предметов перепутаны: их не разделить никакой плоскостью, потому что точки одного лежат по обе стороны от точек другого. Вдоль вентрального маршрута они постепенно распутываются, и в нижневисочной коре разделение достигается простейшим правилом, линейным считыванием, то есть взвешенной суммой активностей с порогом.
Чем эта формулировка лучше слов про укрупнение признаков: из неё следует то, чем можно ошибиться. Возьмите популяцию клеток нижневисочной коры и популяцию клеток первичной зрительной коры. Обучите на каждой линейный классификатор различать два предмета. Проверьте его на изображениях этих же предметов в новых положениях и размерах. Предсказание: на нижневисочной коре перенос удаётся, на первичной нет, и не потому, что там меньше сведений, а потому, что они уложены в форме, из которой линейно не достаются. Если бы обе популяции переносились одинаково, формулировку следовало бы выбросить.
И существенная деталь, которую пересказы теряют. Распутывание не означает, что положение и размер отброшены: из той же популяции их тоже можно считать. Система не жертвует одним ради другого, а перекладывает данные так, что оба вопроса решаются легко, тогда как на входе легко не решается ни один.
Сколько на самом деле удерживается
Раз описание строится, естественно спросить, сколько его хранится. Курс психологии разбирал слепоту к изменениям как явление. Здесь она нужна как ограничение на устройство репрезентации.
Саймонс и Левин (1998) вынесли опыт на улицу. Экспериментатор подходил к прохожему и спрашивал дорогу. Посреди разговора между ними проносили дверь, за которой его подменял другой человек, в другой одежде, другого роста, с другим голосом. Подмену заметила примерно половина прохожих. Дальше самое интересное: обнаружение зависело от того, принадлежал ли прохожий к той же социальной группе, что и экспериментаторы. Свои замечали, чужие нет.
Читать это надо аккуратно, и Саймонс с Ренсинком (2005) специально разобрали, какие выводы отсюда следуют, а какие нет. Соблазнительный вывод «зрительная система почти ничего не хранит» из необнаружения не выводится. Между «репрезентация не построена» и «изменение не отмечено» лежат ещё два шага: репрезентация могла быть построена и не сопоставлена с новой, могла быть сопоставлена и не попасть в отчёт. Чтобы заключать о разреженности, эти возможности надо закрывать отдельно, а закрывают их редко.
Что следует твёрдо: удержанное через перерыв отбирается не по величине физического различия. Одежда, рост и голос различались заметно, и этого не хватило, а принадлежность к общей социальной группе решала. Правдоподобное чтение состоит в том, что в одном случае собеседник удерживался как отдельный человек, а в другом на уровне категории, которую подмена не меняла. Это чтение согласуется с описанием, оптимизированным под узнавание, но самим опытом не доказано, и подавать его надо именно как чтение.
Схема вывода, которую стоит держать в голове при любом отчёте о «слепоте» к чему-либо: не отмечено может означать не построено, построено и не сопоставлено, сопоставлено и не отражено в отчёте. Три разные вещи, и различает их не наблюдение самого факта необнаружения, а дополнительные измерения, например косвенные показатели вроде движений глаз или последующего выбора без инструкции сравнивать.
Прямой прогон и его пределы
Скорость из первого раздела даёт сильное ограничение. Сигналу нужно примерно полтораста миллисекунд, чтобы один раз пройти иерархию снизу вверх. Значит, для изрядной доли изображений хватает одного прохода, без возвратов и уточнений.
«Изрядной доли» не значит «всех», и разница здесь содержательная. Кар, Кубилиус, Шмидт, Исса и Ди Карло (2019) искали изображения, на которых прямые свёрточные сети ошибаются, а обезьяны и люди справляются, и нашли сотни таких. Для этих изображений достаточное для опознания решение возникало в нижневисочной коре примерно на тридцать миллисекунд позже, чем для контрольных, подобранных по трудности. Задержка ровно того порядка, какого требует проход по возвратным связям.
Формулировка, которая выдерживает данные: базовое узнавание в основном укладывается в прямой прогон, но часть изображений требует дополнительной обработки, и её след в записях виден. Спор о том, насколько велика эта часть и что именно делают возвратные связи, остаётся открытым, и держать его открытым стоит: обе крайние позиции сейчас сильнее данных.
Искусственные системы: что показано и чего не показано
Сравнение с машинным распознаванием в этом сюжете неизбежно, и подавать его надо осторожнее, чем принято. Установлены три вещи, и в «сети видят как человек» они не складываются.
Первое. Яминс с коллегами (2014) отбирали модели по качеству решения задачи категоризации, а не по биологическому правдоподобию. И лучшая по качеству оказалась заодно лучшим предсказателем ответов нейронов в V4 и в нижневисочной коре. Осмысленный вывод отсюда такой: требование хорошо решать задачу само по себе загоняет систему в узкий класс решений, и зрительная кора, судя по этим измерениям, находится в том же классе.
Второе. Раджалингам и коллеги (2018) собрали больше миллиона проб: 1472 человека, пять макак, 2400 изображений, 24 предмета, 276 задач попарного различения. На уровне предметов, то есть какие предметы с какими путаются, сети предсказывали приматов точно. На уровне отдельных изображений, в вопросе о том, какие именно снимки окажутся трудными, все проверенные сети оказались значимо непредсказывающими, и расхождение не объяснялось простыми свойствами изображений и не устранялось простыми доработками моделей. Люди и макаки при этом сходились друг с другом и на уровне изображений.
Третье. Гейрхос с коллегами (2019) построили изображения с конфликтом формы и текстуры. Обученные на стандартном наборе свёрточные сети отвечали по текстуре, тогда как человек отвечает по форме. Совпадение ответов на обычных изображениях, стало быть, не означает совпадения признаков, по которым ответ получен.
Отсюда две дисциплины. Первая: сравнивать надо на том разрешении, где сравнение способно провалиться, по отдельным изображениям, а не по усреднённым показателям. На грубом разрешении совпадёт многое и ничего не будет значить. Вторая: этот курс не делает прогнозов о том, чего искусственные системы достигнут дальше. Утверждение «модель предсказывает ответы нейронов лучше прежних» относится к сегодняшним измерениям на сегодняшних наборах изображений, и переносить его во времени нет оснований.
Правило переносится далеко за пределы зрения. Если две системы сравнивают по показателю, который у множества разных механизмов получается одинаковым, совпадение ничего не сообщает о механизме. Полезны те показатели, по которым системы уже расходятся между собой: у Раджалингама и коллег люди и макаки согласуются на уровне отдельных изображений, а сети с ними расходятся, значит, разрешение выбрано верно.
Что забрать из модуля
Три урока отвечали на один вопрос с трёх сторон. Седьмой: как устроен вход и что значит слово «карта». Восьмой: как обработка расходится и как проверяется утверждение о маршруте. Девятый: какую задачу всё это решает и чем измерена её трудность.
Общий итог таков. Зрение не передача изображения внутрь, а последовательное переписывание входа в форму, из которой нужный ответ достаётся просто. Что считать нужным ответом, зависит от того, для чего он: узнать предмет и взять его в руку это разные вычисления с разными требованиями. И почти каждое утверждение в этой области держится не на одном красивом наблюдении, а на сходимости методов, которые могли бы разойтись.
Что изменилось
Две картинки чередуются с короткой паузой между ними. Одна деталь отличается. Засеките, сколько времени вам понадобится, чтобы её найти.
Ключевые работы
| Thorpe, Fize, Marlot, «Speed of processing in the human visual system», Nature 381 | 1996 | Предъявление новых фотографий по 20 мс. Различие в лобной активности между пробами развивается примерно через 150 мс после начала стимула. |
| Simons, Levin, «Failure to detect changes to people during a real-world interaction», Psychonomic Bulletin & Review 5 | 1998 | Подмену собеседника за пронесённой дверью заметила примерно половина прохожих. Обнаружение зависело от принадлежности к той же социальной группе. |
| Simons, Rensink, «Change blindness: past, present, and future», Trends in Cognitive Sciences 9 | 2005 | Разбор правомерных и неправомерных выводов: необнаружение изменения само по себе не устанавливает разреженности или отсутствия репрезентаций. |
| DiCarlo, Zoccolan, Rust, «How does the brain solve visual object recognition?», Neuron 73 | 2012 | Многообразия объектов перепутаны в ранних областях и распутываются вдоль вентрального маршрута до линейной разделимости в нижневисочной коре. |
| Yamins, Hong, Cadieu, Solomon, Seibert, DiCarlo, «Performance-optimized hierarchical models predict neural responses in higher visual cortex», PNAS 111 | 2014 | Модель, отобранная по качеству решения задачи, оказалась лучшим предсказателем ответов нейронов в V4 и нижневисочной коре. |
| Rajalingham, Issa, Bashivan, Kar, Schmidt, DiCarlo, «Large-scale, high-resolution comparison of the core visual object recognition behavior…», Journal of Neuroscience 38 | 2018 | Более миллиона проб: сети предсказывают приматов на уровне предметов и значимо не предсказывают на уровне отдельных изображений. |
| Kar, Kubilius, Schmidt, Issa, DiCarlo, «Evidence that recurrent circuits are critical to the ventral stream's execution of core object recognition behavior», Nature Neuroscience 22 | 2019 | На сотнях «трудных» изображений приматы справляются, а прямые сети нет. Решение возникает в нижневисочной коре примерно на 30 мс позже. |
| Geirhos, Rubisch, Michaelis, Bethge, Wichmann, Brendel, «ImageNet-trained CNNs are biased towards texture», ICLR | 2019 | При конфликте формы и текстуры обученные свёрточные сети отвечают по текстуре, а человек по форме. |
Что подтвердилось, а что нет
Явление воспроизводится надёжно, а вывод из него нет. Саймонс и Ренсинк (2005) разобрали цепочку: между «репрезентация не построена» и «изменение не отмечено» лежат ещё два звена. Репрезентация могла быть построена и не сопоставлена с новой, могла быть сопоставлена и не попасть в словесный отчёт. Чтобы заключать о разреженности, эти возможности надо закрывать отдельными измерениями. Держится узкая формулировка: через перерыв удерживается не всё, и отбор идёт не по величине физического различия.
Совпадение есть, но не на том уровне, на котором утверждение имеет смысл. Раджалингам и коллеги (2018) на более чем миллионе проб показали: картину смешений на уровне предметов сети воспроизводят точно, а на уровне отдельных изображений все проверенные модели значимо не предсказывают приматов, тогда как люди и макаки согласуются между собой. Гейрхос и коллеги (2019) добавили механизм расхождения: при конфликте формы и текстуры сети отвечают по текстуре, человек по форме. Совпадение результата и совпадение механизма остаются разными утверждениями.
В пользу прямого прогона говорит скорость: решение поспевает примерно за 150 мс, чего хватает на один проход снизу вверх (Торп и коллеги, 1996). Против абсолютной формулировки говорят сотни изображений, на которых прямые модели ошибаются, а приматы нет, причём достаточное решение возникает в нижневисочной коре примерно на 30 мс позже (Кар и коллеги, 2019). Открыто, какова доля таких изображений в естественном зрении и что именно вычисляют возвратные связи. Обе крайние позиции сейчас сильнее имеющихся данных.
Термины
- инвариантностьinvariance
- Независимость описания от превращений, сохраняющих тождество предмета: сдвига, поворота, изменения размера, освещения, частичного закрытия.
- многообразие объектаobject manifold
- Поверхность, которую образуют в пространстве активности популяции нейронов ответы на все изображения одного и того же предмета.
- базовое узнавание объектовcore object recognition
- Опознание предмета при коротком предъявлении и естественных изменениях вида, укладывающееся примерно в двести миллисекунд.
- нижневисочная кораinferior temporal cortex
- Верхняя ступень вентрального маршрута. Популяция её нейронов позволяет линейно считывать тождество предмета при изменениях его положения, размера и позы.
- линейное считываниеlinear readout
- Получение ответа взвешенной суммой активностей популяции с порогом. Если ответ достаётся так, сведения считают представленными в явном виде.
- прямой прогонfeedforward processing
- Однократное прохождение сигнала по иерархии снизу вверх, без возвратов и уточнений.
- возвратная обработкаrecurrent processing
- Обработка с участием обратных и внутриуровневых связей. Проявляется задержкой, с которой в записях возникает достаточное для опознания решение.
- глубокая свёрточная сетьdeep convolutional neural network
- Искусственная многоуровневая система распознавания изображений, обучаемая на размеченных наборах. Используется и как модель вентрального маршрута, и как источник проверяемых расхождений с ним.
Практикум · Что осталось от изображения
Здесь надо увидеть на своём материале, что мера сходства на яркостях не отслеживает тождество предмета, и научиться формулировать вывод из необнаружения так, чтобы он был правомерен. Понадобятся телефон с камерой и любой редактор изображений с пипеткой. 30-45 минут.
- Выберите один предмет и снимите его десять раз, меняя за раз что-то одно: расстояние, ракурс, освещение, частичное закрытие, фон. Снимки не обрабатывайте и не кадрируйте.
- Откройте два самых непохожих снимка и измерьте пипеткой яркость в пяти точках с одинаковыми координатами в обоих. Выпишите пять пар чисел и посчитайте сумму модулей разностей. Это грубая мера расхождения входных данных при неизменном предмете.
- Снимите другой предмет так, чтобы по этим же пяти точкам он оказался ближе к одному из первых десяти снимков, чем те десять друг к другу. Если получилось, вы построили ровно ту ситуацию, из-за которой поиск похожего для узнавания не годится. Если не получилось за три попытки, запишите, что вам мешало.
- Проверка на удержание. Сделайте два снимка захламлённого стола, различающихся ровно одним изменением, и покажите их двум людям, чередуя с пустой вставкой примерно на полсекунды. Засеките, сколько чередований потребовалось каждому. Тренажёр к уроку делает то же самое на готовом материале. Сверьтесь с ним.
- Напишите три предложения о результате шага 4: что он устанавливает твёрдо, какие два объяснения необнаружения он не различает, какое дополнительное измерение позволило бы их различить. Формулировка «человек ничего не запомнил» без такого различения ответом не считается.
Вопросы для самопроверки
Почему узнавание нельзя устроить как поиск наиболее похожего изображения в памяти?
- Потому что памяти не хватит на все изображения: их число растёт быстрее, чем можно запасти клеток
- Потому что сравнение с запасом изображений заняло бы больше 150 миллисекунд, а узнавание укладывается в этот срок
- Потому что изображения хранятся не в зрительной коре, а в гиппокампе, и зрительная система обращаться к этому хранилищу за образцом для сравнения не может
- Потому что похожесть на уровне яркостей не отслеживает тождество предмета: два вида одного стула бывают дальше друг от друга, чем стул от чемодана
Что означает утверждение, что вдоль вентрального маршрута многообразия объектов распутываются?
- Что высшие области отвечают каждая только на один предмет, и узнавание сводится к поиску той единственной клетки, которая сработала
- Что тождество предмета становится доступно линейному считыванию при изменениях его положения, размера и позы
- Что сведения о положении и размере по дороге отбрасываются как помеха
- Что число нейронов, занятых предметом, уменьшается на каждом следующем уровне
Вы хотите проверить гипотезу о распутывании так, чтобы она могла не подтвердиться. Какой замысел годится?
- Показать, что нижневисочная кора активируется на предметы сильнее, чем на шум: если распутывание есть, отклик должен расти от уровня к уровню
- Показать, что повреждение нижневисочной коры нарушает узнавание предметов, и заключить, что она и делает работу по распутыванию
- Обучить линейный классификатор на популяции первичной зрительной коры и на популяции нижневисочной и сравнить, как каждый переносится на новые положения и размеры того же предмета
- Сравнить время реакции при узнавании привычных и непривычных ракурсов: если многообразие распутано, разницы между ракурсами быть не должно, и наблюдаемое равенство времён гипотезу подтвердит
Примерно половина прохожих не заметила, что собеседника подменили. Какой вывод отсюда правомерен?
- Что через перерыв удерживается не всё и удержанное отобрано не по величине физического различия
- Что зрительная система вообще не строит подробных репрезентаций и удерживает лишь общий смысл сцены
- Что подмену не заметил бы никто вообще, если бы одежда у двух собеседников оказалась совсем одинаковой
- Что внимание прохожих было занято вопросом о дороге и к устройству зрения опыт отношения не имеет
Сети предсказали, какие предметы приматы путают друг с другом, но не предсказали, какие именно изображения окажутся трудными. Почему второе важнее первого?
- Потому что первое получено на макаках, а второе на людях, и переносить результат с вида на вид нельзя
- Потому что совпадение на грубом разрешении достигается многими несхожими механизмами, а расхождение на тонком указывает, что механизмы разные
- Потому что предсказание отдельных изображений и есть единственная задача, ради которой вообще строят модели зрения, и всё прочее к делу не относится
- Потому что усреднение по изображениям статистически некорректно и стирает настоящую картину смешений
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- James DiCarlo, Davide Zoccolan, Nicole Rust, «How does the brain solve visual object recognition?», Neuron, 2012: Обзор, задающий постановку задачи. Читать ради того, как расплывчатое «узнавание» превращается в геометрическое утверждение, которое можно опровергнуть.
- Rishi Rajalingham и коллеги, «Large-scale, high-resolution comparison of the core visual object recognition behavior…», Journal of Neuroscience, 2018: Образец сравнения, устроенного так, чтобы оно могло провалиться. Обратите внимание на разницу между уровнем предметов и уровнем отдельных изображений.
- Daniel Simons, Ronald Rensink, «Change blindness: past, present, and future», Trends in Cognitive Sciences, 2005: Четыре страницы о том, какие выводы из явления следуют, а какие нет. Полезно далеко за пределами зрения.
- Robert Geirhos и коллеги, «ImageNet-trained CNNs are biased towards texture», ICLR, 2019: Простой приём (конфликт формы и текстуры), которым различают два механизма, дающие одинаковый ответ на обычных изображениях.