ai deep-dive 認識 AI 模型 2026年8月26日 預訓練、SFT、RLHF:模型從「補完文字」變成「有用助理」的三個階段 所有 LLM 都經過三階段訓練:預訓練讀完網路學會語言、SFT 用示範對話學會格式、RLHF 用人類偏好學會什麼回答比較好。Base model 到 chat model 的差距,就是後兩個階段做的事。 #pre-training#sft#rlhf#dpo#fine-tuning#ai-model#training#alignment