Reinforcement Learning. Основы и марковский процесс
Определение
Основная концепция
Агент в обучении с подкреплением
Агент в обучении с подкреплением
Марковский процесс
Марковский процесс. Матрица переходов
Марковский процесс. Эпизод
Марковский процесс с наградами
Марковский процесс с наградами. Основные формулы
Пример расчета ценности состояния (γ=0.5)
Марковский процесс принятия решений
Марковский процесс принятия решений. Ценность действия
Марковский процесс принятия решений. Пример расчетов
Марковский процесс принятия решений. Функции оптимальности
Марковский процесс принятия решений. Функции оптимальности
4.37M

Reinforcementlearning1

1. Reinforcement Learning. Основы и марковский процесс

Красников Н.С.

2. Определение

Обучение с подкреплением - это вычислительный подход к
пониманию и автоматизации целенаправленного обучения и
принятия решений. Он отличается от других вычислительных
подходов тем, что делает акцент на обучении агента на основе
прямого взаимодействия с окружающей средой, не требуя
примерного наблюдения или полных моделей окружающей
среды
2

3. Основная концепция

O – данные из внешней
среды
(ее состояние)
А – множество действий
агента
R – награда за переход в
следующее состояние
3

4. Агент в обучении с подкреплением

На шаге t:
• Агент выполняет
действие
English     Русский Правила