Обучение с подкреплением: когда ответов нет, а есть только очки
Обучение с подкреплением это обучение через награду за исход действий. Системе не показывают правильных ответов: она действует, получает очки за результат и подстраивает поведение так, чтобы очков было больше. Так учат играть и управлять. Главная трудность в том, что награда приходит поздно, и неясно, какое из прошлых действий её заслужило.
Обучение с подкреплением: обучение через награду за исход действий. Главная трудность в том, что награда приходит поздно, и неясно, какое из прошлых действий её заслужило.
Три способа учить машину
Машинное обучение переворачивает обычный порядок: на вход подают данные и ответы, а получают правило, в виде набора чисел. Способов дать ответы три. Обучение с учителем: к каждому примеру приложен правильный ответ, к снимку «есть перелом», к письму «спам». Самый распространённый и самый требовательный вид, потому что размечают примеры люди.
Обучение без учителя: данных много, ответов нет, и просят найти структуру, разбить покупателей на группы, заметить необычные транзакции. Обучение с подкреплением: ответов тоже нет, но есть награда за исход. Система делает ход, получает очки и меняет поведение. Отсюда разница с учителем: учитель говорит, что было правильно, награда говорит только, что вышло хорошо или плохо.
Почему поздняя награда это трудно
В шахматной партии награда одна и приходит в конце: выиграл или проиграл. Какой из сорока ходов её заслужил, а какой был ошибкой, из награды не видно. Это называют задачей приписывания заслуг, и большая часть методов подкрепления посвящена именно ей: как распределить одну позднюю награду по цепочке ранних действий.
Вторая трудность такая: чтобы найти лучшие действия, надо пробовать и плохие. Система, которая всегда выбирает лучшее из известного, не узнает, что есть лучше. Баланс между использованием проверенного и разведкой нового тоже часть метода, а не деталь.
Где ошибаются
Первая ошибка: думать, что награда это и есть цель. Система оптимизирует число, которое ей дали, а не то, что имел в виду разработчик. Лодка в гоночной игре, которая кружит на месте и собирает бонусы вместо финиша, набирает больше очков, чем честный гонщик, и с точки зрения обучения права она.
Вторая ошибка: путать подкрепление с дообучением языковых моделей на человеческих предпочтениях. Там подкрепление используется как техника, но ответы модели оценивают люди, и награда строится из их оценок. Это делает ответы приятнее и удобнее, а не правдивее.
Вопросы
- Где применяется обучение с подкреплением?
- В играх, от го до видеоигр, в управлении роботами и оборудованием, в рекомендациях, а также при дообучении языковых моделей на оценках людей.
- Чем оно отличается от обучения с учителем?
- Учитель даёт правильный ответ на каждый пример, награда даёт только оценку исхода, часто отложенную и общую для цепочки действий.
- Откуда термин?
- Из психологии обучения: подкреплением называют событие, которое делает поведение более частым. Бихевиористы изучали это на животных, а в машинном обучении слово взяли для той же идеи.
Где это разобрано подробно
Понятие из урока 2 курса «Искусственный интеллект»: Правило не пишут, а выучивают. О самом курсе, его программе и источниках рассказано на странице курса.