Skip to content
所有標籤

#sft

3 篇文章
ai deep-dive 認識 AI 模型

預訓練、SFT、RLHF:模型從「補完文字」變成「有用助理」的三個階段

所有 LLM 都經過三階段訓練:預訓練讀完網路學會語言、SFT 用示範對話學會格式、RLHF 用人類偏好學會什麼回答比較好。Base model 到 chat model 的差距,就是後兩個階段做的事。

CS336 Lecture 15:SFT 教模型模仿,RLHF 才開始直接最佳化偏好

第十五講把 post-training 拆成 imitation 與 optimization:SFT 從 instruction-response data 抽出預訓練已有能力,RLHF 用 pairwise feedback 跨過人類示範與偏好之間的落差;PPO 與 DPO 都逃不掉資料偏差、reward overoptimization 和 mode collapse。

大型語言模型:分詞、Transformer、MoE 與 SFT

第 17 章從 next-token loss 推到 Transformer、KV cache、MoE 與 SFT,說清楚 LLM 的訓練目標、架構與推論成本如何連在一起。