Skip to content
所有標籤

#reinforcement-learning

22 篇文章
tech Harvard CS50 AI 導讀

Harvard CS50 AI Week 4:Learning——監督式學習、k-NN、SVM、強化學習 Q-learning 與 Nim

Week 4 進入機器學習:監督式分類(k-NN、SVM、Perceptron)、模型評估、強化學習基礎(MDP、Q-learning、ε-greedy),專案 Shopping 預測購買意願、Nim 學會玩遊戲。

ai deep-dive 認識 AI 模型

後訓練 RL 三條路線:Ornith、Nous Research、MiniMax 怎麼用強化學習做出黑馬模型

2026 年三個非大廠團隊用不同的 RL 後訓練路線做出 benchmark 黑馬:Ornith 讓模型自己出題自己改進(GRPO self-improvement loop),Nous Research 用 DataForge 合成資料 + Atropos 執行獎勵 RL,MiniMax 在 20 萬個真實環境裡大規模 RL。三條路各有強項,但共同證明了一件事:後訓練 RL 比預訓練規模更重要。

tech deep-dive AI 模型家族

Nous Research:從研究社群到開源 AI 生態系的反叛者

Nous Research 不預訓練,只做 fine-tuning 和 RL——Hermes 4 在 MATH-500 拿 96.3%,NousCoder-14B 只用 24K 樣本就把 Qwen3-14B 的 coding 能力拉高 7%。但真正的護城河是 Hermes Agent 框架:236K GitHub stars,全球第 19 名,3,000 位貢獻者。

tech deep-dive AI 模型家族

Ornith:小團隊用自我改進 RL 做出的開源 Coding 黑馬

DeepReinforce 用 self-improvement RL 訓練的 Ornith 1.5 家族:397B 旗艦在 SWE-bench Verified 拿 86.0 追平 Claude Opus 4.8,35B-A3B 每 token 只啟用 3B 參數卻在同量級 coding benchmark 全面領先,9B 版本可以跑在手機上。MIT 授權、完全開源。

ai deep-dive RAG 技法大全

Agentic / Reasoning RAG:從 Search-R1 的 RL 多輪搜索到 Deep Research 與 MCP 的推理×檢索新範式

2025 年的 RAG 不再是「檢一次、生成一次」。Search-R1 用 RL 讓模型在推理中自主多輪搜索,REX-RAG/AlignRAG 補上策略與對齊的分支,OpenAI Deep Research 把整條鏈產品化,MCP 則把檢索泛化為統一的工具調用。本文拆開設計哲學、與舊世代的取捨、以及何時該用這套新範式。

ai deep-dive AI 頂會導讀

2021 AI 頂會導讀:機器學習篇

2021 年是 diffusion model 超越 GAN、自監督學習理論突破、RL 評估方法論覺醒的一年。NeurIPS 收了 9,122 篇投稿創當時紀錄,ICLR 的 Score-Based Generative Modeling 論文日後成為整個 diffusion 生態的理論基石,ICML 則在優化理論與自監督學習動力學分析上交出紮實貢獻。

CMU 07-280 完整課程導讀:搜尋、GPT-2、AlphaZero 為什麼在同一門課?

07-280 是 CMU Spring 2026 首開的 AI+ML 核心:24 講、12 個作業編號,從 heuristic search、CSP 與機器學習一路做到 AlexNet、GPT-2、AlphaZero。教材足以自學,但沒有完整公開錄影、Canvas checkpoint 或 Gradescope 回饋。

CMU 07-280 Lecture 21:Bellman Equation 如何解 Markov Decision Process

第 21 講把隨機序列決策寫成已知 dynamics 的 MDP,以 Bellman backup 定義 value 與 Q-value,再用 value iteration 或 policy iteration 求最佳 policy。

CMU 07-280 Lecture 22:不知道 Dynamics 時如何做 Q-learning

第 22 講保留 MDP 骨架,拿掉已知 transition 與 reward 的假設;TD learning 用一步 sample 更新 value,Q-learning 再以 off-policy target 直接學最佳 action values。

CMU 07-280 Lecture 23:從 Approximate Q-learning 到 DQN

第 23 講以 Qθ(s,a) 取代巨大 Q-table:先用 features 線性近似並由 squared TD error 推導 gradient update,再以 replay data 與固定 target network 形成 DQN。

CMU 07-280 Lecture 24:Monte Carlo Tree Search 如何接上 AlphaZero

Spring 2026 Lecture 24 是 MCTS,不是 Fall 2026 的 LLM post-training;本講以 selection、expansion、rollout、backup 與 UCB 分配模擬,再由 policy/value heads 與 self-play 接到 AlphaZero。

CMU 07-280 階段複習三:從 MDP、Q-learning 到 AlphaZero

第三階段把 value、policy、bootstrapping、function approximation 與 MCTS 接成 AlphaZero:network 提供先驗與估值,search 改善決策,self-play 再產生下一輪資料。

CS224N 第 12 講:Decoding、DeepSeek-R1 與推理訓練

第 12 講先證明輸出策略不是小細節:greedy、beam 與 sampling 會產生不同文字;再由 R1-Zero/R1 走進 PPO、GRPO、DAPO,最後追問長推理何時真的有用。

CS336 Lecture 16:RLVR 用可驗證獎勵擴大推理,但 GRPO 不是免費的 PPO

第十六講從 PPO 走到 GRPO 與 RLVR:數學、程式碼和環境結果提供可規模化 reward,避開一般偏好模型的部分 overoptimization;但 group-normalized advantage 會引入難度與長度偏差,rollout infrastructure 也成為主要成本。

強化學習:MDP、價值迭代與連續狀態

第 19 章用 Bellman 方程把長期決策拆成一步更新,並從已知 MDP 的 value iteration 走到模型學習與連續狀態近似。

策略梯度及其變體:REINFORCE 與 PPO

第 21 章從 log-derivative trick 推出 REINFORCE,再用 reward-to-go、baseline 與 PPO clipping 控制 policy-gradient 的高變異與更新幅度。

CS188 MDP 與強化學習:從 Value Iteration 到 Q-Learning

Lecture 9–12 與 Project 3 用同一個 Gridworld 對照已知模型的 value iteration、未知模型的 Q-learning,以及用 features 泛化的 approximate Q-learning。

Berkeley CS285 L19–25:探索、RL 理論、多任務學習與開放問題

最後七講從 exploration 與理論界線,經兩講期中複習,走到 advanced exploration、multi-task RL 與仍未解決的研究問題。

Berkeley CS285 L1–4:模仿學習、分布偏移與 RL 基礎

前四講從 behavioral cloning 走到 MDP;HW1 再用 MSE policy、DAgger 與 flow matching,讓分布偏移從概念變成可觀察的失敗。

CMU 10-301 HW8:從 MDP 到 Reinforcement Learning 更新規則

HW8 把 state、action、reward、transition 與 value update 接起來,驗收你能否區分環境動態、policy 與估計誤差。

Stanford CS221 導讀:AI 入門課的先修欄位,寫的是 CS103、CS106B、CS109、CS161

CS221 把 AI 排成一條軸:反射式模型(也就是深度學習)在最低階那一格,往上是狀態、變數、邏輯。2025 年秋季 Percy Liang 接手後把講義換成可執行的 Python,並在第一堂的原始碼裡寫下『Cut constraint satisfaction problems :(』——但 ExploreCourses 與 Stanford Online 兩個官方頁面到現在還把約束滿足列為課程主題。專案已經從 2019 年的兩成成績掉到只剩加分。

Deep Reinforcement Learning:把 RLHF 放回強化學習的框架裡

圍棋不能用監督式學習的第三個理由最有意思:ground truth 本身就沒有良好定義——最強的人類不是每天下出最好的棋,而他最好的棋也不是最優解。這一講的最後 20 分鐘把 RLHF 完整放回 RL 的框架:agent 是被微調的模型、action 是下一個 token、一個 episode 是一次完整生成,而且獎勵極度稀疏。