Китайская комната и тест Тьюринга
Три позиции, сорок с лишним лет спора и ни одной решающей проверки
Китайская комната это мысленный опыт Джона Сёрла 1980 года: человек по книге правил манипулирует иероглифами незнакомого языка, снаружи это выглядит пониманием, и вывод Сёрла таков, что синтаксис не даёт семантики. Главное возражение называют системным ответом: понимает не человек внутри, а система целиком, то есть человек, книга правил и порядок работы вместе. Спор идёт сорок с лишним лет, решающей проверки нет.
Сёрл, 1980. Бендер, Гебру, Макмиллан-Мейджор и Митчелл, 2021. Работы по интерпретируемости · 26 мин · обновлено 01.10.2026
После урока вы сможете
- Восстанавливать аргумент китайской комнаты и главное возражение на него
- Держать дословно формулировку про стохастических попугаев и знать, что она утверждает
- Отличать утверждение о механизме от утверждения о понимании
- Знать, что про нейросети известно точно, а что неизвестно
Попросите языковую модель объяснить, почему стакан с ледяной водой запотевает снаружи. Ответ придёт складный и верный. Воздух у холодной стенки остывает, и водяной пар оседает на ней каплями. Спросите про очки, запотевшие с мороза, и ответ будет таким же верным.
Почти каждый, кто это видел, задаёт себе один и тот же вопрос. Понимает ли она, о чём говорит, или просто складывает слова, которые обычно стоят рядом? Вопрос кажется естественным, и на него хочется быстрого ответа. Быстрого ответа нет уже сорок с лишним лет.
Спорят об этом не любители, а исследователи, философы и инженеры. У каждой стороны есть аргумент, и ни у одной нет решающей проверки. Этот урок раскладывает три позиции: мысленный опыт Сёрла, формулировку про стохастических попугаев и попытку заглянуть модели внутрь. Вердикта в конце не будет, и ниже объяснено, почему это точный ответ, а не уклонение.
Слово, у которого нет измерителя
Начать придётся со слова. «Понимает» пришло из словаря про людей. В разговоре о машинах оно работает как метафора, пока не оговорено иначе. У людей мы тоже не измеряем понимание напрямую: мы задаём вопросы и судим по ответам.
Другого хода у нас нет, и с машиной он даёт сбой. Причину показали ещё в 1966 году. Программа ELIZA переставляла ключевые слова из реплики и возвращала их вопросом, а люди приписывали ей сочувствие, зная, как она устроена. Отсюда правило первого урока: наше впечатление, что машина понимает, доказательством не является.
Обратное впечатление, впрочем, тоже ничего не доказывает. Ощущение «да это же просто подстановка» возникает так же легко и так же мало проверено. Оба ощущения приходят от одного и того же: мы судим о внутреннем по внешнему, потому что другого доступа у нас нет.
Отсюда и устройство спора. Стороны расходятся не в том, что машина делает. Механизм известен и описан. Они расходятся в том, что считать доказательством понимания. Спор о критерии измерением не закрыть: измерять пришлось бы по критерию, о котором и спорят.
Китайская комната
В 1980 году философ Джон Сёрл предложил мысленный опыт, который обсуждают до сих пор. Человек, не знающий китайского, сидит в закрытой комнате. Снаружи ему подают листки с китайскими иероглифами. У него есть толстая книга правил на родном языке: увидев такой-то набор значков, выложи в ответ такой-то другой.
Он сверяется с книгой, складывает ответ и отдаёт наружу. Снаружи всё выглядит как разговор: ответы осмысленны, собеседник за дверью уверен, что комната знает китайский. Человек внутри при этом не понял ни одного слова. Он двигал значки по их форме, ничего не зная об их значении.
Вывод Сёрла строится в три шага. Программа это правила обращения со знаками по их форме, то есть синтаксис. Понимание требует связи знака со значением, то есть семантики. Из формы значение не следует, а значит, никакая программа сама по себе не понимает.
Важно, на что нацелен аргумент. Он не о слабой машине и не о нынешних моделях: Сёрл строит его против любой программы, включая безупречную. Комната по условию отвечает так, что снаружи её не отличить от человека. Поэтому ссылки на новые системы аргумента не задевают, и это делает его удобным для одной стороны и раздражающим для другой.
Есть, впрочем, обстоятельство, которое стоит помнить. Сёрл писал в 1980 году, когда в области господствовал символьный подход: знания записывают правилами, вывод получают логически. Комната даёт точную картинку ровно такой программы. Переносится ли аргумент на системы, которые правила не получают, а выучивают из примеров, остаётся отдельной линией спора, моложе самого аргумента.
Китайскую комнату как философский аргумент разбирает курс философии: там смотрят на его посылки, форму вывода и место среди других доводов о сознании. Здесь она берётся иначе, как позиция в споре о машинах, наравне с двумя другими. Реконструкции в две-три строки для этого достаточно.
Системный ответ и что было дальше
Главное возражение появилось сразу и называется системным ответом. Понимает не человек в комнате, а система целиком: человек, книга правил, картотека и порядок работы вместе. Спрашивать отдельно человека так же странно, как спрашивать отдельный нейрон, понимает ли он русский. Ответ будет «нет» в обоих случаях, и ни о чём это не говорит.
Сёрл ответил и на это. Пусть человек выучит книгу наизусть и проделывает всё в уме, без бумаг и картотеки. Теперь система целиком помещается внутри него, а китайского он по-прежнему не знает. Значит, дело не в том, что понимание распределено по частям.
Критики возражают и здесь. Заучив правила, человек завёл внутри себя вторую систему, и вопрос о её понимании остаётся ровно там же, где был. Незнание китайского самим человеком тут ничего не решает: спрашивают не о нём. Дальше спор идёт по кругу, и круг этот в литературе описан десятки раз.
Полезно назвать вещи своими именами. За сорок с лишним лет ни одна сторона не предъявила наблюдения, которое закрыло бы вопрос. В реестре курса это стоит со статусом «спор открыт», не из вежливости, а как описание положения дел. Аргумент не опровергнут и не доказан. Он остаётся позицией, у которой есть сторонники и есть возражения.
Стохастические попугаи
Вторая позиция моложе на сорок лет и устроена иначе. В 2021 году Эмили Бендер, Тимнит Гебру, Анджелина Макмиллан-Мейджор и Маргарет Митчелл выпустили работу «On the Dangers of Stochastic Parrots». Языковая модель названа в ней системой, которая сшивает последовательности из обучающих данных без отсылки к значению. Формулировку стоит держать дословно: пересказывают её обычно грубее, чем она написана.
Разберём оба слова. «Попугай» указывает на воспроизведение: наружу выходит пересобранное то, что уже было в данных. «Стохастический» говорит о случайности: следующий кусок выбирается из распределения вероятностей, поэтому ответы каждый раз немного разные. Вместе получается описание механизма, хотя звучит как насмешка.
Работа была не только о понимании. Авторы поставили вопрос о цене обучения таких моделей и о том, что предвзятость данных переходит в модель. Обе темы к этому уроку прямого отношения не имеют, но объясняют, почему работу читали далеко за пределами спора о семантике.
Стоит заметить, чем эта позиция отличается от комнаты Сёрла. Сёрл говорит о любой программе в принципе, и данные его не интересуют вовсе. Здесь речь о конкретном классе систем и о том, как именно их учили: на текстах, без доступа к тому, о чём эти тексты написаны. Утверждение уже по охвату, зато ближе к проверке.
Расходятся спорящие и в том, что считалось бы такой проверкой. Одни предлагают смотреть, справляется ли модель с задачами, которых в обучении заведомо не было. Другие отвечают, что проверить это негде: состав обучающих данных огромен и обычно закрыт. Та же трудность разбирается в уроке 14 под именем загрязнения. Тестовые задачи попадают в обучение, и результат начинает мерить запоминание.
У работы четыре автора: Эмили Бендер, Тимнит Гебру, Анджелина Макмиллан-Мейджор и Маргарет Митчелл. Последняя подписана не своим именем: в статье стоит «Шмаргарет Шмитчелл». Митчелл и Гебру вместе вели в Google команду, занимавшуюся этикой ИИ, и компания потребовала снять имена своих сотрудников со статьи. Гебру выполнять требование отказалась и в декабре 2020 года лишилась работы. Митчелл требование выполнила буквально, переделав своё имя на насмешливый лад, как в детской дразнилке. В феврале 2021 года уволили и её. Псевдоним так и остался в списке авторов, и встретив «Shmargaret Shmitchell» в библиографии, стоит знать, чья это подпись.
«Просто предсказывает слово» это не вывод
Из формулировки про попугаев вырос самый ходовой довод в этом споре. Звучит он так: модель просто предсказывает следующее слово, значит, никакого понимания там нет. Первая половина фразы верна буквально. Механизм именно таков, и уроки 10 и 11 разбирают его подробно. Вторая половина из первой не следует.
Посмотрим, где обрывается вывод. Чтобы хорошо угадывать продолжение текста, полезно улавливать то, о чём текст написан. Продолжая детектив словами «убийцей оказался», выгодно отслеживать, кто где был и у кого был мотив. Отсюда не следует, что модель это делает. Следует лишь, что описание механизма вопроса не решает.
Симметрия здесь полная, и это главное. Из «предсказывает токены» не выводится ни «понимает», ни «не понимает». Фраза работает в обе стороны и потому не работает ни в одну. В реестре курса утверждение «модель просто предсказывает слова, значит не понимает» стоит со статусом «спор открыт».
Чтобы сдвинуть вопрос, довода о механизме мало. Нужен разговор о том, что внутри механизма происходит: какие величины вычисляются, на что они откликаются, что изменится, если их тронуть. Такой разговор начат, и ведёт его третья сторона.
Фразы «Это же просто статистика слов» и «оно улавливает смысл, иначе бы так не отвечало» несут один и тот же изъян. Обе выводят утверждение о внутреннем из внешнего описания: первая из описания механизма, вторая из впечатления от ответа. Проверить их одинаково нечем, и потому спор с их помощью движется по кругу.
Третья сторона: заглянуть внутрь
Две первые позиции спорят снаружи, по поведению и по описанию механизма. Есть и третий ход: открыть модель и посмотреть, что в ней вычисляется. Этим занимается интерпретируемость, направление, изучающее внутреннее устройство обученных сетей. Оно не берётся решать, что называть пониманием, и в этом его сила.
Работа устроена примерно так. Ищут устойчивые внутренние величины, которые включаются на определённых свойствах входа, и называют их признаками. Потом проверяют причинно: величину меняют искусственно и смотрят, изменится ли ответ предсказуемым образом. Если изменится, значит, она в вычислении действительно участвует, а не совпала случайно.
Результаты реальны и частичны. Отдельные внутренние представления найдены и описаны, отдельные цепочки вычислений прослежены. Полного объяснения поведения крупной модели на 2026 год нет, и обещать его к сроку никто не может. Это честная середина между «всё понятно» и «сплошной чёрный ящик».
Отсюда важная поправка к ходовой фразе. Утверждение «мы совсем не понимаем, как работают нейросети» стоит в реестре курса со статусом «сильно ослаблено». Механика обучения известна точно: её пишут люди, она умещается в несколько формул, и урок 4 разбирает её по шагам. А какие именно представления и вычисления возникают у конкретной обученной модели, неизвестно.
Здесь это похоже на разницу между правилами игры и записью конкретной партии. Правила мы написали сами и знаем полностью. Что получилось в отдельно взятой партии, приходится разбирать отдельно. Ломается аналогия вот где: партию можно записать ход за ходом и прочитать целиком, а внутренности обученной модели пока читаются кусками. Дальше различения двух видов знания эту аналогию тянуть не стоит.
Почему спор не закрывается
Соберём три позиции вместе и посмотрим, о чём каждая. Сёрл спорит о принципе: может ли программа как таковая иметь значение для своих знаков. Бендер и соавторы спорят о классе систем и о способе, которым их обучили. Интерпретируемость о слове не спорит вовсе, а меряет то, что поддаётся измерению.
Позиции не пересекаются настолько, чтобы одна опровергала другую. Можно принять аргумент Сёрла и всё равно считать интерпретируемость полезной. Можно отвергнуть аргумент Сёрла и всё равно согласиться с формулировкой про сшивание последовательностей. Спор устроен не как ринг, где в конце кто-то один остаётся стоять.
Мешает и отсутствие согласованной проверки. Предложенная в 1950 году игра в имитацию отвечает на другой вопрос: сумеет ли собеседник отличить машину от человека в переписке. Комната Сёрла проходит эту проверку по построению, а формулировка про попугаев описывает систему, которая пишет гладко. Обе позиции строятся ровно на том, что неотличимость вопроса о понимании не решает.
Добавьте сюда эффект ИИ из первого урока. Всякий раз, когда машина начинает надёжно решать задачу, задачу вычёркивают из списка требующих интеллекта. С пониманием происходит то же самое: планка тихо переезжает вслед за результатом. Спор, у которого критерий движется, закрыться не может по устройству.
Что остаётся твёрдого
Урок кончается без вердикта, и это не фигура речи. Объявить исход значило бы сообщить читателю, что известно нечто неизвестное. Курс так не делает нигде, а здесь особенно: вопрос о понимании остаётся самым старым из открытых мест области. Зато твёрдого остаётся больше, чем кажется, и стоит перечислить.
Механизм известен. Что модель делает с входом, чтобы получить выход, описано и проверяемо. Спорят не о механизме, а о том, что из него следует.
Впечатление не доказательство. Ощущение понимания возникает и от программы в несколько сотен строк, как показал случай ELIZA. Обратное ощущение так же ненадёжно, и по той же причине.
Ссылка на предсказание слов ничего не решает. Фраза «просто предсказывает следующее слово» верна и бесполезна как довод. Она равно доступна обеим сторонам, а значит, не даёт преимущества ни одной.
Часть внутреннего устройства уже видна. Отдельные представления и цепочки вычислений найдены и проверены вмешательством. Полного объяснения крупной модели нет, но «сплошной чёрный ящик» уже неверное описание.
Этого набора хватает, чтобы не попасть в ловушки обеих сторон. Восторг «оно всё понимает» и снисходительность «это просто автодополнение» опираются на одну ошибку: вывод о внутреннем делается из внешнего впечатления. Курс запрещает себе и то и другое, не из осторожности, а потому, что оснований нет ни для одного.
Что дальше
Модуль VII собран из споров, у которых сегодня нет решения, и это первый из трёх. Следующий урок пойдёт о сроках и рисках: кто утверждает, что очень способные системы близки и опасны, и кто возражает, что этот разговор отвлекает от вреда сегодняшнего. Правило то же, что здесь: позиции с носителями и аргументами, исход не объявляется.
Там же пригодится история двух зим из третьего урока. Область дважды переоценила себя, но однажды и похоронила себя поспешно: нейросети объявили тупиком в 1969 году, а через семнадцать лет препятствие сняли. Читать прогнозы придётся в обе стороны, и это труднее, чем кажется.
Ключевые работы и результаты
| Вейценбаум, ELIZA | 1966 | Программа на несколько сотен строк, имитирующая психотерапевта переформулировкой реплик. Люди приписывали ей понимание, зная её устройство. Отсюда правило, что впечатление доказательством не является. |
| Сёрл, «Minds, Brains, and Programs» | 1980 | Мысленный опыт с китайской комнатой: человек по книге правил манипулирует иероглифами, не зная языка, а снаружи это выглядит пониманием. Вывод: синтаксис не даёт семантики, и потому программа сама по себе понимать не может. Главное возражение называют системным ответом. |
| Бендер, Гебру, Макмиллан-Мейджор и Митчелл, «On the Dangers of Stochastic Parrots» | 2021 | Языковая модель названа системой, сшивающей последовательности из обучающих данных без отсылки к значению. Работа поставила также вопросы цены обучения и переноса предвзятости данных в модель. |
Что подтвердилось, а что нет
Аргумент Сёрла (1980) построен на китайской комнате и нацелен на любую программу в принципе, включая безупречную. Главное возражение называют системным ответом: понимает не человек внутри, а система целиком. Сёрл ответил и на него, критики возразили на ответ, и за сорок с лишним лет ни одна сторона не предъявила наблюдения, которое закрыло бы вопрос.
Первая половина фразы верна буквально: механизм именно таков. Вывод из неё не следует. Чтобы хорошо предсказывать текст, полезно улавливать структуру того, о чём текст написан. Из описания механизма не выводится ни «понимает», ни «не понимает»: фраза работает в обе стороны и потому не даёт преимущества ни одной.
Механика обучения известна точно: её пишут люди, она умещается в несколько формул и разбирается в уроке 4 по шагам. Неизвестно при этом, какие именно внутренние представления и вычисления возникают у конкретной обученной модели. Интерпретируемость находит отдельные представления и прослеживает отдельные цепочки. Полного объяснения поведения крупной модели на 2026 год нет.
Термины
- китайская комнатаChinese room
- Мысленный опыт Сёрла (1980): человек по книге правил манипулирует иероглифами незнакомого языка, и снаружи это выглядит пониманием. Нацелен против любой программы, а не против конкретной системы.
- синтаксис и семантикаsyntax and semantics
- Синтаксисом называют правила обращения со знаками по их форме, а семантикой связь знака со значением. Весь спор вокруг китайской комнаты идёт о том, даёт ли первое второе.
- системный ответsystems reply
- Главное возражение на китайскую комнату: понимает не человек внутри, а система целиком, то есть человек, книга правил и порядок работы вместе. Спрашивать отдельную деталь так же странно, как отдельный нейрон.
- стохастический попугайstochastic parrot
- Формулировка 2021 года: языковая модель сшивает последовательности из обучающих данных без отсылки к значению. «Стохастический» указывает на выбор следующего куска из распределения вероятностей.
- интерпретируемостьinterpretability
- Направление, изучающее, что вычисляется внутри обученной сети: устойчивые внутренние величины и их причинная роль в ответе. Результаты частичны: полного объяснения поведения крупной модели нет.
- внутреннее представлениеinternal representation
- Устойчивая величина внутри сети, которая откликается на определённое свойство входа. Считается участвующей в вычислении, если её искусственное изменение предсказуемо меняет ответ.
- эффект ELIZAELIZA effect
- Готовность приписывать программе понимание и намерения, если её поведение достаточно похоже на разумное, причём даже при знании её устройства.
Практикум · Спор без слова «понимает»
Половина споров о понимании держится на том, что слово не разобрано. Приём простой: убрать слово и посмотреть, что останется от утверждения. Обычно остаётся меньше, чем казалось, зато остаток можно обсуждать.
- Найдите свежее утверждение о том, что модель что-то понимает или, наоборот, ничего не понимает. Годится заголовок, пост в сети, реплика в разговоре.
- Выпишите отдельно, что именно наблюдал автор: какой был запрос, какой ответ, сколько раз это проверено и на каких примерах.
- Перепишите утверждение без слова «понимает», оставив только наблюдаемое. Фраза станет скучнее и точнее. Сравните, много ли в ней осталось.
- Задайте обеим сторонам один вопрос: какое наблюдение заставило бы вас передумать? Если внятного ответа нет ни у кого, спор идёт о слове, а не о машине.
- Сохраните разбор с датой. Через год перечитайте: изменились ли ваши требования к слову «понимает» вслед за тем, что машины научились делать.
Вопросы для самопроверки
Что именно утверждает аргумент китайской комнаты?
- Что программы того времени были слишком просты, чтобы понимать, и с ростом сложности понимание появится
- Что машина не сумеет вести осмысленную беседу и снаружи её всегда можно будет отличить от человека
- Что манипуляция знаками по форме не даёт значения, и потому программа не понимает
- Что вопрос о понимании зависит от определения и потому неразрешим
В чём состоит системный ответ на китайскую комнату?
- Понимает не человек внутри, а всё устройство целиком: человек, книга правил и порядок работы
- Комната не понимает, потому что человек внутри не знает китайского, а он тут единственный, кто мог бы понимать
- Система из человека и книги правил работает слишком медленно, чтобы её ответы считались пониманием
- Понимание нельзя определить, поэтому вопрос бессмыслен
Как звучит формулировка про стохастических попугаев?
- Модель дословно повторяет заученные фразы, выбирая их наугад
- Модель выбирает слова из словаря наугад
- Модель понимает текст хуже человека, но лучше животного, и место ей отвели где-то посередине
- Модель сшивает последовательности из обучающих данных без отсылки к значению
Какой статус в реестре курса у утверждения «мы совсем не понимаем, как работают нейросети»?
- Выдержало: внутренности обученной модели закрыты для изучения, и заглянуть внутрь пока нечем
- Сильно ослаблено: механика обучения известна точно, неизвестны представления конкретной обученной модели
- Миф: поведение крупных моделей объяснено полностью
- Спор открыт: единого мнения о механике обучения нет, и разные школы описывают её по-разному
Почему урок о понимании кончается без вердикта?
- Чтобы не задеть ни одну из спорящих сторон: в спорных вопросах курс держится нейтральности из вежливости
- Потому что вопрос о понимании к делу отношения не имеет: на устройство и применение систем ответ не влияет
- Потому что решающей проверки нет, и вердикт сообщил бы больше, чем известно
- Потому что ответ даётся в следующем уроке
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- John Searle, «Minds, Brains, and Programs», Behavioral and Brain Sciences, 1980: Сам мысленный опыт занимает страницу, а дальше идёт разбор возражений, включая системный ответ. Полезно увидеть, что возражения были предъявлены сразу, а не придуманы позже недовольными.
- Bender, Gebru, McMillan-Major, Shmitchell, «On the Dangers of Stochastic Parrots», 2021: Читать стоит целиком: формулировка про сшивание последовательностей занимает в работе меньше места, чем вопросы о цене обучения и о предвзятости данных.