Skip to content
所有標籤

#markov-decision-process

1 篇文章

CMU 07-280 Lecture 21:Bellman Equation 如何解 Markov Decision Process

第 21 講把隨機序列決策寫成已知 dynamics 的 MDP,以 Bellman backup 定義 value 與 Q-value,再用 value iteration 或 policy iteration 求最佳 policy。