강화학습 Part 2 Markov Decision Processes
본 정리는 팡요랩(Pang-Yo Lab) 의 강화학습 강의(David Silver의 Reinforcement Learning Lecture 2: Markov Decision Processes)를 듣고 정리한 리뷰이다. Part 1에서 잡은 큰 그림을 바탕으로, 이번에는 강화학습 환경을 수학적으로 기술하는 틀인 MDP를 다룬다.전체 그림을 먼저 깔면 이렇다. 가장 단순한 마르코프 프로세스(MP)에 보상과 할인을 붙이면 마르코프 리워드 프로세스(MRP)가 되고, 거기에 행동(선택)을 붙이면 마르코프 결정 프로세스(MDP)가 된다. 즉 한 줄로 줄이면 MRP = MP + 보상, MDP = MRP + 행동이다.1. 마르코프 성질 (Markov Property)한 문장으로는 "미래는 현재가 주어지면 과거와 독립이..