ai deep-dive Stanford CS229 導讀 2026年8月22日 LLM 推理:思維鏈與長推理 RLVR 第 18 章把 LLM 推理拆成兩個槓桿:推論時用思維鏈增加計算,訓練時用可驗證獎勵與 policy gradient 學出長推理行為。 #cs229#llm-reasoning#chain-of-thought#rlvr#ppo