Actor‑Critic
Policy gradient шумел, Q-learning умел оценивать состояния. Поселим их в одном агенте: актёр выбирает действия, критик подсказывает, насколько каждое из них оказалось лучше ожидаемого — и учатся они одновременно, на каждом шаге.
Baseline, который зависит от места
В части 3 мы вычитали из отдачи базовую линию
Хвалить нужно не за «высокую отдачу вообще», а за отдачу выше ожидаемой из этого места. То есть базовая линия должна зависеть от состояния:
Вместо константы
Одна беда:
Одно число, которое движет обоих
Раз критик есть, можно пойти дальше. REINFORCE ждал конца эпизода, чтобы узнать настоящую отдачу
Это та же TD-ошибка из части 2 — здесь она служит оценкой преимущества
Красота в том, что одно и то же
Учимся на каждом шаге
Заметьте, что исчезло: нам больше не нужен конец эпизода.
Одношаговый Actor-Critic
- инициализировать предпочтения
и ценности - повторять для каждого эпизода:
старт - пока
не терминальное: - выбрать
; выполнить: получить и (для терминального : ) — критик для всех — актёр
Онлайн-обновление — не косметика. Оно означает, что метод работает в задачах без конца: робот, который никогда не «доигрывает эпизод», сервер, балансирующий нагрузку непрерывно. REINFORCE там неприменим в принципе — ему некуда дождаться
Актёр и критик бок о бок
Знакомая сетка, но теперь у агента две «головы», и мы смотрим на обе сразу. Слева — критик: тепловая карта его прогноза
В одном эпизоде сопоставьте изменение оценки критика с изменением вероятности выбранного действия. Что происходит при положительной и отрицательной TD-ошибке? Затем запустите серию эпизодов и сравните поведение у цели и у старта.
Проверьте совет из Главы 3: поставьте
Когда критик решает
Финальный эксперимент. Два агента — REINFORCE с baseline (часть 3) и actor-critic — учатся с нуля на одной карте, одинаковыми темпами. График показывает среднюю отдачу за эпизод: выше — лучше, оптимум отмечен ровной «полкой», к которой кривые должны прижаться.
Сначала сравните методы на короткой карте при одинаковом числе эпизодов, затем выберите длинный коридор. Отдельно оцените скорость обучения и колебания возврата. Достаточно ли одного показанного прогона, чтобы утверждать превосходство метода?
Это и есть главный вывод части: преимущество критика растёт с горизонтом задачи. Короткие эпизоды прощают Monte-Carlo; длинные — нет.