Классическое обусловливание и обучение
Как смежность уступила информативности, а обучение свелось к ошибке предсказания
Обусловливание работает не на простой смежности стимулов, а на ошибке предсказания: обучение происходит ровно настолько, насколько событие оказалось неожиданным. Это правило модели Рескорлы и Вагнера, и из него выводятся приобретение, угасание и блокировка. Уже предсказанный безусловный стимул не поддерживает обучение новому сигналу. Ту же величину, расхождение ожидаемого и произошедшего, кодируют дофаминовые нейроны среднего мозга.
MIT 9.00SC, Lecture 9 «Learning» · Open Yale PSYC 110, Lecture 4 «Foundations: Skinner» · 50 мин · обновлено 12.09.2026
После урока вы сможете
- Различать привыкание, классическое и оперантное обусловливание по тому, что именно меняется: реакция на один стимул, связь между стимулами или связь между действием и последствием.
- Объяснять блокировку и контингентность и показывать на примере, почему смежности для обучения недостаточно.
- Читать модель Rescorla и Wagner как правило обучения по ошибке предсказания и выводить из неё приобретение, угасание и блокировку.
- Формулировать, что показало и чего не показало исследование Уотсона и Рейнер, не опираясь на популярные пересказы.
- Связывать поведенческие законы обучения с дофаминовым сигналом ошибки предсказания, не смешивая уровни объяснения.
Обучение (learning) в психологии определяют не через знания, а через устойчивое изменение поведения или его потенциала под действием опыта. Самую примитивную форму называют привыканием (habituation): повторяющийся безобидный стимул постепенно перестаёт вызывать реакцию. Зеркальная форма это сенситизация (sensitization): после сильного или болезненного события организм начинает реагировать сильнее даже на слабые стимулы. Ни то, ни другое не требует связи между двумя событиями. Меняется реакция на один.
Эти два процесса стоит держать в голове как методологический ориентир. Привыкание служит рабочей лошадкой исследований младенцев и животных. Если реакция угасла, значит стимул опознан как «уже виденный». Это позволяет спросить у существа без речи, различает ли оно две картинки. Кроме того, привыкание задаёт нижнюю планку объяснения: любая теория более сложного обучения обязана показать, что дело не сводится к простому снижению реактивности.
Павлов: четыре буквы и шесть явлений
Классическое обусловливание (classical conditioning) описано Павловым в работах начиная с 1897 года, а англоязычное издание «Conditioned Reflexes» вышло в 1927-м. Схема такова: пища как безусловный стимул (unconditioned stimulus, US) вызывает слюноотделение, безусловную реакцию (unconditioned response, UR). Нейтральный стимул, регулярно предшествующий US, становится условным (conditioned stimulus, CS) и сам начинает вызывать условную реакцию (CR). Побочный исторический факт, полезный против частой ошибки: Нобелевскую премию 1904 года Павлов получил за физиологию пищеварения, а не за обусловливание.
Павлов же описал основные явления, которыми до сих пор пользуются. Приобретение (acquisition) означает рост CR при повторных сочетаниях. Угасание (extinction) состоит в падении CR, если CS предъявляется без US. Спонтанным восстановлением (spontaneous recovery) называют возврат CR после перерыва. Генерализация (generalization) переносит реакцию на похожие стимулы. Дифференцировка (discrimination) учит различать похожие CS, из которых только один предсказывает US.
Спонтанное восстановление не досадная мелочь, а ключ к правильному пониманию угасания. Если бы угасание стирало ассоциацию, реакции неоткуда было бы вернуться. Восстановление говорит об одном: при угасании строится новый, тормозный след, а старый сохраняется. То же говорят возобновление (renewal) при смене контекста и реинстатирование (reinstatement) после повторного предъявления US. Отсюда прямое клиническое следствие. Экспозиционная терапия не удаляет страх, а надстраивает над ним конкурирующее обучение, и потому рецидивы ожидаемы, а не свидетельствуют о провале метода. Экспозицию проводят в разных контекстах и планируют поддерживающие сессии.
Маленький Альберт: чем важен и почему не доказателен
Watson & Rayner (1920) сочетали белую лабораторную крысу с громким звуком и получили у младенца страх крысы, распространившийся на другие пушистые объекты. Историческая роль работы велика: она перевела эмоции из области интроспекции в область экспериментального контроля и создала родословную поведенческой терапии.
Как доказательство она не выдерживает современных стандартов. Один участник, отсутствие контрольного условия, неоднозначные протоколы наблюдения, никакого документированного расобусловливания. Даже идентичность мальчика и его дальнейшая судьба остаются предметом неразрешённого спора, так что подавать биографический финал как факт нельзя.
Можно: эмоциональные реакции в принципе обусловливаемы, и это подтверждено массой более поздних работ. Нельзя: «фобии возникают именно так» и «эксперимент доказал происхождение страхов». Исследование с одним участником и без контроля не устанавливает механизм. Оно показывает, что явление стоит искать.
Почему смежности недостаточно
Учебниковая формула «связались, потому что шли рядом» описывает смежность (contiguity). Звучит она убедительно, пока не поставлены два эксперимента. В первом животное сначала обучали, что свет предсказывает удар, а затем предъявляли свет вместе с тоном перед тем же ударом. Тон при этом смежен с US идеально, но не обусловливается. Это блокировка (blocking): предсказанный US ничему не учит.
Второй эксперимент варьировал не смежность, а контингентность (contingency): вероятность US при наличии CS против вероятности US без него. Если US одинаково вероятен и в присутствии CS, и в его отсутствие, CR не формируется, сколько бы сочетаний ни было. Обучение идёт не по совместному появлению, а по информативности: организм ведёт себя как оценщик предсказательной ценности сигнала.
Контингентность удобно держать в голове как разность двух вероятностей. Ноль означает, что сигнал не сообщает ничего нового: US приходит с ним и без него одинаково часто. Положительная величина делает CS предсказателем события, а отрицательная превращает его в предсказателя отсутствия, и тогда вырабатывается торможение. Заметьте, что для вычисления этой разности нужны пробы без CS. Организм, как и статистик, обязан считаться с тем, чего не случилось.
Сюда же относится латентное торможение (latent inhibition): стимул, который долго предъявлялся без всяких последствий, потом обусловливается медленнее. Организм успел выучить, что этот стимул ничего не предсказывает, и перестал тратить на него внимание. Значит, внимание и новизна встроены в ассоциативное обучение, а не приложены к нему сбоку.
Два простых эксперимента, обрушивших уравнение «ассоциация = смежность». Смежность необходима, но недостаточна: работает только та смежность, которая приносит новую информацию. Заметьте дизайн. В обоих случаях решает дело контрольное условие, а не основной эффект.
Rescorla-Wagner: формула ошибки
Rescorla & Wagner (1972) записали это одной строкой: ΔV = αβ(λ − ΣV). Разберём её по частям, ничего не предполагая заранее. Величина V означает текущую силу ожидания US, которую даёт этот CS, а ΔV говорит о том, насколько она изменится за одну пробу. Величина ΣV складывает ожидание от всех присутствующих в этот момент сигналов. Символ λ обозначает то, что фактически произошло: максимум, если US был, и ноль, если не был. Параметры α и β задают заметность CS и силу US. Скобка (λ − ΣV) и есть ошибка предсказания (prediction error): расхождение между ожиданием и реальностью.
Из одной формулы следует почти вся феноменология. Приобретение: пока ожидание мало, ошибка велика и обучение идёт быстро, а по мере насыщения ΣV приближается к λ, ошибка стремится к нулю и кривая выходит на плато. Угасание: US не пришёл, λ = 0, ошибка отрицательна, V падает. Блокировка: свет уже обеспечил ΣV примерно на уровне λ, и для тона ошибки просто не осталось. Модель предсказывает и неочевидное, например сверхожидание при объединении двух независимо обученных CS.
Что модель запрещает, важнее того, что она объясняет. Она запрещает обучение при нулевой ошибке: если событие уже полностью предсказано, никакое число повторений ничего не добавит. Она запрещает и рост ожидания выше λ: сигнал не может пообещать больше, чем даёт само событие. И она разделяет два вопроса. Скорость обучения задают заметность сигнала и сила события, а предел задаёт только событие.
Rescorla-Wagner входит в число немногих психологических теорий с настоящей предсказательной силой и служит прямым предком вычислительного обучения с подкреплением. Её границы известны и честно перечислены: она не объясняет латентное торможение, изменения внимания к CS и конфигурационное обучение. Отсюда более поздние надстройки, в которых заметность сигнала сама меняется с опытом, и конфигурационные модели, где сочетание сигналов работает как отдельный сигнал. Известные границы теории говорят о зрелости области, а не о её слабости.
Учит не событие, а неожиданность события. Если мир уже предсказан, обучение останавливается, даже когда стимулы продолжают идти рядом. Проверьте этим правилом любое описание обусловливания: если объяснение обходится без слов «ожидание» и «информативность», оно почти наверняка неполно.
Не все ассоциации равновозможны
Классический бихевиоризм предполагал эквипотенциальность: любой стимул может связаться с любым последствием, были бы соблюдены смежность и повторность. Garcia & Koelling (1966) показали обратное. Крысы связывали новый вкус с последующей тошнотой, а свет и звук с ударом током, но не наоборот. При этом вкусовая аверсия формировалась при отсрочке в часы, что для обычного обусловливания невозможно.
Вывод: обучение биологически подготовлено (preparedness). Ассоциации, полезные для вида, образуются легче и держатся прочнее. Та же логика видна в инстинктивном дрейфе (instinctive drift): обученные животные соскальзывают с выученной последовательности на видотипичные действия. Это не отменяет законы обусловливания, а ограничивает область их применения. Организм приходит в эксперимент не чистой доской, а системой с предустановленными приоритетами.
У этого результата есть прямое человеческое приложение. Пищевые отвращения после единственного эпизода тошноты знакомы почти каждому и держатся годами. Выработать столь же прочную и столь же односочетательную неприязнь к нейтральному звуку не удаётся. Распределение человеческих страхов тоже неслучайно: змеи, высота, замкнутые пространства и скопления людей встречаются в клинике куда чаще, чем электрические розетки или автомобили. При этом вторые опаснее статистически и куда чаще сочетаются с болью. Строгая теория обусловливания такую асимметрию предсказать не может, а подготовленность может.
Оперантное обусловливание: последствия отбирают поведение
Торндайк с его проблемными ящиками сформулировал закон эффекта: действия, за которыми следует удовлетворительный результат, повторяются чаще. Скиннер превратил это в измеримую программу, куда вошли оперантная камера, кумулятивная запись, функциональный анализ поведения. Ключевое различие с Павловым: там реакция вызывается стимулом, здесь она отбирается последствием.
Подкрепление (reinforcement) повышает вероятность поведения, наказание (punishment) снижает. При этом «положительное» и «отрицательное» означают добавление и удаление стимула, а не «хорошее» и «плохое». Отдельно вводится дискриминационный стимул, сигнал о том, что подкрепление доступно. Режимы подкрепления комбинируют фиксированность с тем, что считается: пропорция выполненных реакций или интервал времени. Практический итог: переменная пропорция (variable ratio) даёт поведение, наиболее устойчивое к угасанию. На этом устроены игровые автоматы и лента новостей. Устойчивость объясняется просто: пропуск подкрепления при таком режиме ничем не отличается от обычной паузы внутри него, и заметить перемену правил нечем. Шейпинг (shaping) добавляет подкрепление последовательных приближений к цели и позволяет построить поведение, которого в репертуаре ещё не было.
Вывод о наказании методологический, а не только этический. Данные говорят, что подкрепление желаемого поведения эффективнее и устойчивее. Наказание подавляет реакцию, но обусловливает страх, агрессию и избегание источника, не обучает альтернативе и работает только при немедленности и последовательности. Наказание сообщает «не это», подкрепление сообщает «вот это», и во втором случае обучаемому есть что делать.
Миф, выросший из смешения двух устройств: air crib это термостатируемая кроватка, а не оперантная камера. Вторая частая ошибка состоит в том, что Скиннера считают отрицателем внутренних состояний: он отрицал их объяснительную роль в поведенческом анализе, а не их существование.
Куда всё это привело: карты, дофамин, наблюдение
Толмен и Хонзик обучали крыс в лабиринте без подкрепления и обнаружили резкое улучшение сразу после того, как награду вводили. Толмен назвал это латентным обучением и когнитивными картами. Животное строило репрезентацию пространства, пока никаких подкрепляемых реакций не наблюдалось. Это был первый серьёзный удар по строгому бихевиоризму: измеряемое поведение может молчать, а обучение при этом идти.
Замкнул схему результат Schultz, Dayan & Montague (1997): активность дофаминовых нейронов среднего мозга кодирует именно ошибку предсказания награды. Это всплеск при неожиданной награде, отсутствие ответа на полностью предсказанную и падение ниже базового уровня при пропуске ожидаемой. Это та же величина (λ − ΣV), реализованная нейронами и совпадающая с правилом temporal-difference обучения из машинного обучения. Психологическая модель 1972 года получила нейронный носитель и одновременно вернулась в инженерию как алгоритм.
Картина продолжает уточняться, и полезно не смешивать уровни. У людей видна смесь двух стратегий: model-free работает как дешёвая и негибкая привычка, а model-based планирует по внутренней модели мира. Позже выяснилось, что дофаминовая популяция кодирует не среднее, а распределение будущих награждений и вдобавок раскладывает награду по времени и величине. Скалярная ошибка предсказания оказалась верным первым приближением, а не финалом.
Наконец, опыты с куклой Бобо показали, что новое поведение приобретается наблюдением, без подкрепления наблюдателя. Бандура же развёл приобретение и исполнение. Выучить можно и то, что делать не станешь. Вместе с латентным обучением это очерчивает итог темы: обусловливание описано верно, но как частный случай более общей задачи, построения предсказаний о мире.
Ключевые исследования
| Павлов (Pavlov) | 1927 | Слюноотделение на условный сигнал у собак. Приобретение, угасание, генерализация и дифференцировка становятся измеримыми явлениями. |
| Watson & Rayner | 1920 | Обусловливание страха у младенца и генерализация на пушистые объекты. При n = 1 и без контроля получается демонстрация возможности, а не механизма. |
| Garcia & Koelling | 1966 | Вкус связывается с тошнотой, а боль со светом и звуком. Эквипотенциальность стимулов опровергнута, обучение биологически подготовлено. |
| Kamin | 1969 | Блокировка: уже предсказанный безусловный стимул не поддерживает обучение новому, идеально смежному сигналу. |
| Rescorla & Wagner | 1972 | Формальная модель ΔV = αβ(λ − ΣV): обучение пропорционально ошибке предсказания. Прямой предок вычислительного обучения с подкреплением. |
| Tolman & Honzik | 1930 | Латентное обучение в лабиринте без подкрепления: репрезентация формируется, не проявляясь в поведении. |
| Schultz, Dayan & Montague | 1997 | Дофаминовые нейроны среднего мозга кодируют ошибку предсказания награды в соответствии с temporal-difference обучением. |
Что подтвердилось, а что нет
У Watson & Rayner (1920) один участник, нет контрольного условия, протоколы наблюдения неоднозначны, расобусловливание не документировано. Идентичность и дальнейшая судьба мальчика остаются предметом спора (Beck et al., 2009 против Powell et al., 2014). Обусловливаемость эмоциональных реакций подтверждена, но другими работами. Из «Альберта» следует только то, что явление стоит искать, а происхождение фобий он не установил.
Kamin (1969) и Rescorla (1968) показали, что идеально смежный сигнал не обусловливается, если безусловный стимул уже предсказан другим сигналом или столь же вероятен без него. Корректная формулировка: смежность необходима, но обучение определяется информативностью сигнала, то есть величиной ошибки предсказания. Сама надёжность классического и оперантного обусловливания при этом не оспаривается: это одни из самых воспроизводимых эффектов в психологии.
Классическую формулировку пересмотрели сами авторы: Maier & Seligman (2016, Psychological Review) заключают, что пассивность при неконтролируемом шоке остаётся реакцией по умолчанию, а обучение происходит контролю. Организм научается тому, что событие контролируемо, а не тому, что он беспомощен. Практический вывод меняется на противоположный. Тренировать надо опыт контроля.
Термины
- безусловный стимулunconditioned stimulus
- Стимул, вызывающий реакцию без предшествующего обучения. Например, пища, вызывающая слюноотделение.
- условный стимулconditioned stimulus
- Изначально нейтральный стимул, который после сочетаний с безусловным начинает сам вызывать реакцию.
- угасаниеextinction
- Снижение условной реакции при предъявлении условного стимула без безусловного. След не стирается: строится новый тормозный.
- спонтанное восстановлениеspontaneous recovery
- Возврат угасшей условной реакции после перерыва. Он говорит о том, что исходная ассоциация сохранилась.
- блокировкаblocking
- Явление, при котором уже предсказанный безусловный стимул не поддерживает обучение новому сигналу, предъявляемому вместе с известным.
- контингентностьcontingency
- Разность вероятностей безусловного стимула при наличии условного и в его отсутствие. Она определяет обусловливание сильнее, чем простая смежность.
- ошибка предсказанияprediction error
- Расхождение между ожидаемым и произошедшим. Это величина (λ − ΣV) в модели Rescorla-Wagner и сигнал дофаминовых нейронов среднего мозга.
- шейпингshaping
- Построение нового поведения через подкрепление последовательных приближений к целевой реакции.
- режим подкрепленияschedule of reinforcement
- Правило, по которому подкрепляется поведение: по пропорции или по интервалу, фиксированно или переменно. Переменная пропорция даёт наибольшую устойчивость к угасанию.
- латентное обучениеlatent learning
- Обучение без подкрепления, не проявляющееся в поведении до тех пор, пока не появится причина его использовать.
Практикум · Функциональный анализ и проверка на блокировку
Цель состоит в том, чтобы перевести несколько бытовых ситуаций на язык обусловливания и заметить, где интуитивное описание расходится с моделью ошибки предсказания. 25-35 минут, нужен только блокнот.
- Возьмите одну свою реакцию, которая возникает до события: напряжение при звуке рабочего уведомления, тяга к еде при определённой музыке. Распишите её как US, UR, CS и CR, а затем укажите, чего вам не хватает, чтобы отличить условную реакцию от простого предпочтения.
- Найдите в своём окружении сигнал, который сопровождает нужное событие, но ничего к нему не добавляет: например, рекламу, которая всегда идёт рядом с уже известным вам предложением. Предскажите по правилу (λ − ΣV), будет ли она что-нибудь обусловливать, и объясните, почему смежность здесь не спасает.
- Опишите одну привычку, которую вы или кто-то рядом безуспешно пытались убрать наказанием. Ответьте письменно на два вопроса: какой альтернативе обучало наказание и что подкрепляло само поведение.
- Переверните задачу: спроектируйте шейпинг для навыка, которого у вас пока нет. Четыре-пять последовательных приближений, каждое достижимое, с указанием, что именно будет подкреплять каждое из них.
- Найдите в сети любой популярный текст про «условный рефлекс» и проверьте, встречаются ли в нём слова «ожидание» или «информативность». Если нет, сформулируйте, какое конкретное явление этот текст объяснить не сможет.
Вопросы для самопроверки
Собака уже выучила, что звонок предсказывает еду. Теперь перед едой одновременно включают звонок и зажигают лампу, всего двадцать сочетаний. Лампа почти не вызывает слюноотделения. Чем это объясняется?
- Лампа менее заметна, чем звонок: слабый стимул не может стать условным, сколько его ни сочетай с едой и как долго ни продолжай обучение
- Еда была полностью предсказана звонком, поэтому ошибка предсказания близка к нулю и для лампы обучения не осталось
- Зрительные стимулы у собак не обусловливаются, а на еду работает только слух и обоняние
- Двадцати сочетаний мало: смежность требует не менее сотни повторений, иначе условная связь вообще не успевает закрепиться
Пациент прошёл экспозиционную терапию, страх исчез, а через полгода вернулся. Что говорит об этом теория обусловливания?
- Возврат означает, что угасание не было достигнуто: терапию провели неверно, старый след страха не успел стереться до конца, и работу надо начинать заново
- Возврат доказывает, что страх был не выученным, а врождённым, и обучением такой страх убрать нельзя ни экспозицией, ни чем-то ещё
- Возврат ожидаем: угасание не стирает старый след, а строит конкурирующий тормозный, и старое обучение может проявиться снова
- Возврат возможен только при повторной травме: без нового столкновения с пугающим угасший страх сам по себе не восстанавливается
Крысы легко связывают новый вкус с тошнотой, наступившей через час, но не связывают вкус с ударом током, а свет с тошнотой. Какой учебниковый тезис это опровергает?
- Что условный стимул должен предшествовать безусловному, а не следовать за ним, иначе связь не образуется
- Что угасание стирает выученную связь, а не строит поверх неё новую
- Что подкрепление действует на поведение сильнее, чем наказание
- Что любой стимул может быть связан с любым последствием, если соблюдены смежность и повторность
В популярной статье написано: «Эксперимент с маленьким Альбертом доказал, что человеческие фобии возникают путём классического обусловливания». В чём здесь главная методологическая ошибка?
- Один участник без контрольного условия может показать, что явление стоит искать, но не может установить происхождение фобий
- Расобусловливание Альберта не было проведено, поэтому его данные считаются недействительными и в научный оборот вообще не входят
- Обусловливание страха у людей в современных исследованиях не воспроизводится, поэтому и сам исходный результат считается опровергнутым
- Ошибки нет: исследование корректно поставлено, и вывод о происхождении фобий из его данных следует
Дофаминовые нейроны отвечают всплеском на неожиданную награду, молчат на полностью предсказанную и снижают активность ниже базового уровня, когда ожидаемая награда не приходит. Какому психологическому понятию это соответствует?
- Величине подкрепления как таковой: чем крупнее награда, тем выше всплеск
- Ошибке предсказания, величине (λ − ΣV) из модели Rescorla-Wagner
- Силе безусловной реакции на награду
- Скорости угасания условной реакции
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Stangor, Introduction to Psychology, гл. 7 «Learning»: Базовое изложение обоих видов обусловливания. Свободно доступно на MIT OCW, совпадает с чтением к лекции 9
- Kosslyn & Rosenberg, Introducing Psychology, 4th ed., гл. 4 «Learning: How Experience Changes Us»: Более подробно про режимы подкрепления и наблюдательное обучение
- Gray & Bjorklund, Psychology: Раздел об обучении полезен разбором биологических ограничений научения и критики строгого бихевиоризма