Skip to content

台大 ADL 2025 第 7.5 講:PEFT——Adapter、LoRA、Prompt Tuning 與 HW2

2026年9月30日1 分鐘
TL;DRLLM 大到整個微調不划算時,ADL Fall 2025 的 LLM Adaptation 講義給出三種只改一小部分的做法:在 Transformer 裡插入小型 Adapter、用低秩矩陣表示權重更新的 LoRA,以及只學前綴或軟提示的 prompt tuning。講義的結論是沒有一種方法適合所有任務。HW2 的公開資訊只有一句題目「LLM Tuning and Prompt Tuning for Classical Chinese Translation」,資料、baseline 與評分都沒有文字版。

🌏 English version

這是台大陳縕儂 深度學習之應用 2025 Fall 導讀的第 10 篇。課程是 ADL Fall 2025(114-1,2025/09/01–12/15)。課程頁把 LLM Adaptation 和 Post-Training 排在同一天(9/22),當週助教課是 LLM LoRA Training,作業欄是 HW 2。

本文依據:LLM Adaptation 講義(14 頁)、影片 7.5 Parameter-Efficient Fine-Tuning (Adaptor, LoRA) 如何低成本微調模型(19:21),以及 HW2 說明影片 ADL 2025 Fall Homework 2(13:05,2025-10-06 上傳)。全部在 2026-09-30 打開核對。講義只有 14 頁,而且多數頁是示意圖,所以這篇比前一篇短。

系列位置:上一篇 後訓練:Instruction Tuning、RLHF 與 InstructGPT|下一篇 RAG 與 HW3|系列總覽

問題:整個模型微調太貴

講義的開頭和上一篇共用同一張地圖(第 2–4 頁):要在已知任務上做好,可以做 prompt tuning/engineering,也可以調整 LM 本身。第 4 頁在後者旁邊加了一句:微調 LLM 可能又貴又不實際。第 5 頁因此把主題定為 Parameter-Efficient LM Tuning,也就是更實際的 LLM 調整方式。

第 6 頁列出三個「為什麼需要高效調整」的理由(投影片註明取自 Benji Xie 與 Regina Wang):

  1. 現在的 AI 典範重視準確率多於效率。
  2. 訓練與微調 LLM 有隱藏的環境成本。
  3. 訓練成本越高,AI 開發越集中在資金充足的組織,尤其是產業界。

第 7 頁把共同的想法講成一句話:稍微修改隱藏表示就好,不必動整個模型。

三種做法

Adapter

第 8 頁(講義標註 He 等,2022):在 Transformer block 裡插入小型可訓練的子模組,位置在 multi-head attention 與 feed-forward 之後。重點在最後一行:所有任務共用同一個原始預訓練模型,adapter 是依任務區分的模組,因此更穩健、也更省儲存空間。

LoRA

第 9–11 頁介紹 LoRA(Hu 等,2021):

  • 想法是 low-rank adaptation。圖上把 LoRA 模組畫在 attention 與 feed-forward 旁邊,和原本的權重並聯相加。
  • 依據是第 10 頁那句:下游微調時的權重更新具有低的內在秩(low intrinsic rank)。
  • 第 11 頁用 GPT-3 175B 的實驗結果收尾,結論是 LoRA 有更好的擴展性與任務表現。
LoRA 的低秩更新寫成式子(出自 LoRA 論文,講義以圖表示)

原本的權重 W₀ 是 d×k 的矩陣。LoRA 凍結 W₀,只學兩個小矩陣:

W = W₀ + ΔW = W₀ + B·A
B ∈ R^(d×r),  A ∈ R^(r×k),  r ≪ min(d, k)

要訓練的參數從 d·k 降到 r·(d+k)。推論前可以把 B·A 加回 W₀,不增加額外延遲。這些細節來自 LoRA 論文,講義本身只寫了「low intrinsic rank」這個核心觀察。

Prompt Tuning

第 12 頁只有一句文字:prefix tuning 與 soft prompt tuning 也是參數高效的調整方式。這兩者在第 8 篇的預訓練與 Prompt Learning 已經出現過,這裡的角色是把它們重新歸類到 PEFT 底下:不改模型權重,只學一段接在輸入前面的連續向量。

哪一種比較好?

第 13 頁引 Mao 等 2022 的比較,結論只有一句:沒有一種方法能適合所有任務(No one can fit all tasks)。

做法改動的位置講義給的理由
Adapter在 Transformer 層裡插入新模組原模型共用,adapter 依任務存,穩健且省空間
LoRA在既有權重旁加低秩更新權重更新本來就是低秩;GPT-3 175B 上擴展性與表現更好
Prompt tuning只學輸入前面的前綴或軟提示同樣是參數高效的調整方式

動手的部分交給助教課

同一週的助教課是 LLM LoRA Training。課程頁上的講義連結 f114-adl/doc/w5-LoRA.pdf 在 2026-09-30 回傳 404;同名檔在 Fall 2024 路徑可以打開。課程頁連的影片是 ADL TA Recitation: LLM LoRA Training(18:15),上傳日期是 2023-11-16,也就是沿用往年的錄影。實作細節留給本系列第 18 篇「助教課:從 PyTorch 到 LLM 部署」。

HW2:只拿得到題目

課程頁 9/22 那一列的 HW 2 按鈕直接連到 YouTube 上的 ADL 2025 Fall Homework 2。能確認的只有:

  • 題目:影片說明欄寫「LLM Tuning and Prompt Tuning for Classical Chinese Translation」,也就是用 LLM 調整與 prompt tuning 做文言文翻譯。
  • 影片長度 13:05,2025-10-06 上傳。
  • 對照 Course Logistics 第 11 頁,第二份作業的主題是 LLM Tuning。

拿不到的:這支影片沒有字幕,也沒有公開的規格投影片或文字版說明。資料集、使用的基礎模型、baseline、評分指標、繳交格式與截止日期,本文都無法確認,所以一律不寫。作業繳交走 NTU COOL,需要台大帳號。

校外怎麼做:如果想練這一講的技術,可以把 HW2 當成題目方向,自己準備一小份文言文與白話文的對照資料,比較「只寫 prompt」「prompt tuning」「LoRA」三種做法。評分方式要自己定,結果也無法和官方排行或評分對照。

讀完這一講,你應該能

  • 用一句話說明為什麼 PEFT 有用:只改少量參數,基礎模型能共用。
  • 說出 Adapter、LoRA、prompt tuning 各自改動模型的哪個位置。
  • 解釋 LoRA 為什麼可行:微調時的權重更新具有低的內在秩。

今晚可以做的一件事:拿你手邊任何一個 Transformer 模型的設定,算出某一層 attention 投影矩陣的 d×k,再算 r = 8 時 LoRA 要訓練的 r·(d+k) 個參數,看看比例差多少。這個數字就是第 6 頁那三個理由在實務上的樣子。

延伸閱讀

下一篇:RAG 與 HW3

參考資料