Skip to content
所有標籤

#mdp

3 篇文章

強化學習:MDP、價值迭代與連續狀態

第 19 章用 Bellman 方程把長期決策拆成一步更新,並從已知 MDP 的 value iteration 走到模型學習與連續狀態近似。

CS188 MDP 與強化學習:從 Value Iteration 到 Q-Learning

Lecture 9–12 與 Project 3 用同一個 Gridworld 對照已知模型的 value iteration、未知模型的 Q-learning,以及用 features 泛化的 approximate Q-learning。

CMU 10-301 HW8:從 MDP 到 Reinforcement Learning 更新規則

HW8 把 state、action、reward、transition 與 value update 接起來,驗收你能否區分環境動態、policy 與估計誤差。