Skip to content
所有標籤

#lora

20 篇文章
aiguideCMU 10-423 導讀

CMU 10-423 HW3:用 LoRA 微調 GPT-2——書面題、要改的檔案與算力

CMU 10-423 Spring 2026 的 HW3 總分 66,2026-03-12 截止(Slot A)。書面題考 in-context learning(14 分)、參數高效微調(10 分)和 DPO 推導(15 分);程式題(25 分)要你從零寫 LoRALinear,把它接到 GPT-2 的 attention,再用 Rotten Tomatoes 影評做情感分類的指令微調。實驗全用 gpt2-medium,handout 估計每次訓練在 Colab T4 上 25–30 分鐘,還要一個 WandB 帳號。

aiguideCMU 10-423 導讀

CMU 10-423 L10–L11:參數高效微調與 in-context learning——改少量參數,還是只改輸入

手上只有少量標註資料和一個幾十億參數的 LLM 時,CMU 10-423 給兩條路:監督式微調,或把例子塞進 prompt 做 in-context learning。L10 先說明 2023 年的共識是微調通常贏,再介紹四種只調少量參數的做法:只調最上面幾層、adapter、prefix tuning 與 LoRA。L11 前半回到 in-context learning,說明它對例子順序、標籤比例有多敏感,以及怎麼挑 prompt、什麼是 chain-of-thought。HW3 的書面題與 LoRA 程式題都從這兩講出題。

CMU 11-868 作業六:用 DeepSpeed ZeRO+LoRA 訓練 Llama-2-7B,用 SGLang 做推論

11-868 第六份作業第一次放下自己寫的 MiniTorch,改用產業框架。兩題各 50 分:第一題改一支 DeepSpeed 訓練腳本,打開 LoRA,讓 Llama-2-7B 在 2 張 16GB 的 V100 上訓練得起來;第二題填完 SGLang 推論腳本的 TODO,並調參數讓生成跑快一點。兩題要的 GPU 互相衝突:SGLang 不支援 V100,要換 L40S、A6000 或 A100。春季版 4/13 截止,作業頁不提供評分測資。

CMU 11-868 L23 大模型的高效微調:LoRA、CIAT 與 QLoRA

11-868 第 23 講把微調當成記憶體問題來算:LLaMA-8B 全參數半精度微調約要 80GB,換成 LoRA 約 33GB,再把凍結權重存成 4-bit 的 QLoRA 壓到約 9.2GB。這講的主線是三步:只訓練低秩的 A、B 兩個小矩陣(投影片說這招最早出自 CIAT);用 NF4 查表與雙重量化把凍結權重壓到約 0.52 bytes/參數;用 paged optimizer 在 GPU 快爆時把 optimizer state 換到 CPU。

CS2881R HW0:用 1B 模型親手重現 emergent misalignment

CS 2881R 的 HW0 是選課門檻:用 LoRA 把 Llama-3.2-1B-Instruct 微調在壞的醫療、財務或極限運動建議上,再看它回答無關問題時是否也變得有害。repo 給了加密的訓練資料、generate.py、以 gpt-4o-mini 當裁判的 judge.py,README 的目標是對齊分數低於 75、連貫度高於 50;train.py 是空的,要自己寫。自學時要知道:評分腳本只印平均分數,沒有自動判定過關,拿來比較的基礎模型基準是 20 題醫療題,而你的 CSV 是醫療題與非醫療題各 10 題。

aiguideMIT 6.5940 導讀

MIT 6.5940 第 14 講:LLM 後訓練——從 SFT、RLHF 到只動 1% 參數的高效微調

第 14 講分三段。第一段是微調:SFT 用想要的回答做 next-token prediction,RLHF 先訓 reward model 再用帶 KL 懲罰的 RL 微調,DPO 把兩階段壓成一次監督式訓練;接著一路比較 PEFT:BitFit 只調 bias、Adapter 插小層但推論變慢、Prompt/Prefix-Tuning 佔用輸入長度,LoRA 用可併回權重的低秩分支解決推論延遲,QLoRA 再把主幹量化成 NF4,BitDelta 把微調差值壓到 1 bit。第二段是多模態 LLM:Flamingo 用 cross-attention、PaLM-E 與 VILA 把影像當 token、VILA-U 讓模型也能輸出影像。第三段是 prompt engineering:zero/few-shot、CoT 與 RAG。

政大蔡炎龍 生成式AI 導讀 L11:文字生圖 AI 的原理及實作——CLIP 讀懂 prompt、排程器決定要不要「A 圖」、LoRA 只調 ΔW,最後用 diffusers 做出自己的生圖 Web App

L11 把 Stable Diffusion 架構圖上剩下的三塊補齊。CLIP 用「文字和圖越像越好」的對比訓練,讓 prompt 變成 77×768 的 embedding;排程器把 1000 步的加噪壓成二、三十步的去噪,但 Euler a 這類 ancestral 演算法不會收斂,步數加到 100,人物的衣服和座位都會換掉;LoRA 凍結原本的 W,只學拆成 A·B 的 ΔW。實作用 diffusers 載入 SD 1.5 系模型,第十一週作業是自己做一個生圖 Web App。

清大高宏宇 NLP 導讀:Parameter-Efficient Fine-Tuning——沒有 A100 叢集,怎麼微調大模型

高宏宇 Fall 2025 的 PEFT 投影片先算一筆帳:Llama 2-7B 用 16-bit 全參數微調約要 56GB 顯示卡記憶體,只訓練 0.2M 個參數就降到約 17GB,因為梯度和優化器狀態幾乎歸零。接著用 intrinsic dimensionality 解釋為什麼只調一小撮參數就夠:預訓練越久、模型越大,微調需要的有效維度越低。方法分成加參數(Adapters、Prompt Tuning)、挑參數(BitFit)、重參數化(LoRA)與混合(MAM Adapters、S4)四類;後半段從 GPT-2 的任務描述、verbalizer 一路講到 prefix tuning 和 soft prompt tuning 的取捨。

台大 ADL 2025 第 7.5 講:PEFT——Adapter、LoRA、Prompt Tuning 與 HW2

LLM 大到整個微調不划算時,ADL Fall 2025 的 LLM Adaptation 講義給出三種只改一小部分的做法:在 Transformer 裡插入小型 Adapter、用低秩矩陣表示權重更新的 LoRA,以及只學前綴或軟提示的 prompt tuning。講義的結論是沒有一種方法適合所有任務。HW2 的公開資訊只有一句題目「LLM Tuning and Prompt Tuning for Classical Chinese Translation」,資料、baseline 與評分都沒有文字版。

台大 ADL 2025 助教課:從 PyTorch、Hugging Face 到 LoRA、量化與 vLLM 部署

ADL Fall 2025 課程頁排了 7 堂助教課:Dev Infra(PyTorch、Debugging)→ NLP 專案的一生 → NLP 專案的底層邏輯 → LLM LoRA Training → LLM Basics/Architecture/MoE → LLM Inference & Evaluation → LLM Deployment。10 支影片全部是林彥廷在 2023 與 2024 年錄的舊片,Fall 2025 沿用;課程頁上的 5 份講義連結都 404,同名檔在 Fall 2024 路徑可以打開,Deployment 只有影片。前三堂把 Hugging Face 的「資料→模型→Demo」流程走一遍,正好是 HW1 需要的工具;後四堂補 LLM 的訓練、推論與上線。

李宏毅 ML 2026 HW5:把 Llama 教會算數學,又不讓它忘了怎麼拒絕

HW5 用 LoRA 在 GSM8K 上微調 Llama-3.2-1B-Instruct,同時拿 AILuminate 的危險提示檢查它還會不會拒絕。數學正確率和安全率要同時過線才拿得到 baseline 分數,所以重點是「怎麼微調才不會把安全行為洗掉」。題目 PDF、34 個 cell 的 Colab 與 Kaggle 版都公開,strong baseline 在 T4 上預估要跑 14 小時;評分平台 JudgeBoi 在 2026-09-30 回傳 502,校外只能自己搭 safeguard 評估。

CME295 第 4 講:LLM 訓練的帳單,預訓練、SFT 與 LoRA 各花在哪裡

CME295 第 4 講把 LLM 訓練拆成兩段:先用上兆個 token 做預訓練(Llama 3 用了 15 兆),再用數千到數百萬筆示範資料做 SFT,讓模型從「接話」變成「回答」。中間穿插一張省記憶體的地圖:ZeRO、FlashAttention、混合精度;最後用 LoRA 與 QLoRA 讓沒有大 GPU 的人也能微調,QLoRA 在 65B 模型上省下約 16 倍 VRAM。

從零訓練的框架:LitGPT 的無抽象重寫、pretrain 流程與 TinyLlama 實績

LitGPT(Lightning AI,約 13,600 stars,Apache 2.0)把 Llama 3、Qwen2.5、Phi 4 等 20+ 個 LLM 逐一從零重寫成無抽象層的單檔實作,附 pretrain / finetune / evaluate / serve 完整命令列;1.1B 參數、3T tokens 的 TinyLlama 就是用它的程式碼訓出來的。這篇拆解它與 MiniMind 的差異、實際用法與限制。

MiniMind:用 3 塊錢從零訓練一個 LLM

MiniMind 是一個從零開始訓練 LLM 的開源專案:64M 的 Dense 模型與 198M-A64M 的 MoE 模型,單張 3090 約 2 小時、約 3 元人民幣就能跑完 Pretrain → SFT → LoRA → DPO → PPO/GRPO/CISPO → Agentic RL 的完整流程。所有核心演算法用 PyTorch 原生實作,不依賴高階封裝。

aiguide

個人學模型訓練要租 GPU 嗎:GPUtw.ai、LoRA、Jupyter 與第一輪實驗

GPUtw.ai 適合個人把短租 GPU 當成學習工具:先跑 Jupyter、Ollama、ComfyUI,再用 LoRA/QLoRA 做小模型微調。它不是大型基礎模型訓練平台,第一次使用應該小額測部署、計費與資料保存。

aiguide

Unsloth 完整指南:在本地微調和運行 LLM 的加速工具

Unsloth 是目前最省 VRAM、最快的本地 LLM 微調工具,訓練速度快 2 倍、VRAM 省 70%。2026 年加入 Desktop 桌面應用後,整合了推論、微調、圖片影片生成、web search 和 agent 連接,從微調庫變成完整的本地 AI 工作站。

CS224N 第 9 講:Prompting、LoRA 與參數高效微調

第 9 講比較 prompting、pruning、LoRA、prompt tuning 與 adapters:它們都在回答同一題——要讓一個大型預訓練模型適應新任務,究竟需要改多少參數與儲存多少任務狀態?

CS224N 第 18 講:Tinker and LoRA Without Regret 材料缺口紀錄

第 18 講由 John Schulman 客座,官方只公布題名 Tinker and LoRA Without Regret、日期與講者,沒有投影片、agenda 或閱讀;因此本篇只保存可確認事實與不可確認清單。

基礎模型概覽:線性探測、微調與 LoRA

第 15 章比較線性探測、完整微調與 LoRA:差別不只在可訓練參數量,也在表徵是否移動、資料需求與記憶體成本。

跳頻不是加密:ExpressLRS 原始碼與台灣的頻道數功率上限

ExpressLRS 的跳頻順序由一句綁定口令經 MD5 推出 UID、再餵給一個線性同餘產生器算出來,完全可複現(我移植成 Python 跟原始 C 碼逐位元對過),而鏈路本身沒有任何加密,只有 14 bit CRC。台灣 LP0002 又讓頻道數變成功率上限:2.4 GHz 跳頻用滿 75 個頻道可以發 1 W,不足只能發 0.125 W。