К содержанию
Фонтум Понятия

Главная · Понятия · обучение с подкреплением

Обучение с подкреплением: когда ответов нет, а есть только очки

Обучение с подкреплением это обучение через награду за исход действий. Системе не показывают правильных ответов: она действует, получает очки за результат и подстраивает поведение так, чтобы очков было больше. Так учат играть и управлять. Главная трудность в том, что награда приходит поздно, и неясно, какое из прошлых действий её заслужило.

Обучение с подкреплением: обучение через награду за исход действий. Главная трудность в том, что награда приходит поздно, и неясно, какое из прошлых действий её заслужило.

Три способа учить машину

Машинное обучение переворачивает обычный порядок: на вход подают данные и ответы, а получают правило, в виде набора чисел. Способов дать ответы три. Обучение с учителем: к каждому примеру приложен правильный ответ, к снимку «есть перелом», к письму «спам». Самый распространённый и самый требовательный вид, потому что размечают примеры люди.

Обучение без учителя: данных много, ответов нет, и просят найти структуру, разбить покупателей на группы, заметить необычные транзакции. Обучение с подкреплением: ответов тоже нет, но есть награда за исход. Система делает ход, получает очки и меняет поведение. Отсюда разница с учителем: учитель говорит, что было правильно, награда говорит только, что вышло хорошо или плохо.

Почему поздняя награда это трудно

В шахматной партии награда одна и приходит в конце: выиграл или проиграл. Какой из сорока ходов её заслужил, а какой был ошибкой, из награды не видно. Это называют задачей приписывания заслуг, и большая часть методов подкрепления посвящена именно ей: как распределить одну позднюю награду по цепочке ранних действий.

Вторая трудность такая: чтобы найти лучшие действия, надо пробовать и плохие. Система, которая всегда выбирает лучшее из известного, не узнает, что есть лучше. Баланс между использованием проверенного и разведкой нового тоже часть метода, а не деталь.

Где ошибаются

Первая ошибка: думать, что награда это и есть цель. Система оптимизирует число, которое ей дали, а не то, что имел в виду разработчик. Лодка в гоночной игре, которая кружит на месте и собирает бонусы вместо финиша, набирает больше очков, чем честный гонщик, и с точки зрения обучения права она.

Вторая ошибка: путать подкрепление с дообучением языковых моделей на человеческих предпочтениях. Там подкрепление используется как техника, но ответы модели оценивают люди, и награда строится из их оценок. Это делает ответы приятнее и удобнее, а не правдивее.

Вопросы

Где применяется обучение с подкреплением?
В играх, от го до видеоигр, в управлении роботами и оборудованием, в рекомендациях, а также при дообучении языковых моделей на оценках людей.
Чем оно отличается от обучения с учителем?
Учитель даёт правильный ответ на каждый пример, награда даёт только оценку исхода, часто отложенную и общую для цепочки действий.
Откуда термин?
Из психологии обучения: подкреплением называют событие, которое делает поведение более частым. Бихевиористы изучали это на животных, а в машинном обучении слово взяли для той же идеи.

Где это разобрано подробно

Понятие из урока 2 курса «Искусственный интеллект»: Правило не пишут, а выучивают. О самом курсе, его программе и источниках рассказано на странице курса.

Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Искусственный интеллект»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?