Skip to content

清大 NLP 課程總結與 LLM Reasoning 筆記:一張三欄地圖收掉整學期,再用 Denny Zhou 的演講問「預訓練模型會不會推理」

2026年9月30日1 分鐘
TL;DRFall 2025 第 14 週,高宏宇用兩份投影片收尾:Course_summary 把整學期分成 NLP Fundamentals、NLP Models、NLP Advances 三欄,外加助教課兩欄與五個延伸方向;另一份是他整理的 Denny Zhou(Google DeepMind)2025 年 4 月 Stanford 演講筆記,主張「預訓練模型本來就能推理,關鍵在解碼」,並用 CoT decoding、self-consistency、retrieval + reasoning 串成四條不等式。Fall 2026 的 W16「Reasoning / Agent」單元尚未公開。

🌏 English version

本文依據清大高宏宇《自然語言處理》Fall 2025(114-1)的官方教材。 這是 清大高宏宇 自然語言處理 導讀系列第 18 篇,接續 RAG 助教課+HW4。

用到的官方材料有三份,都掛在 2025 課表的 W14 列:Course_summary.pdf(7 頁)、Note_from_Google_DeepMind's_Reasoning_Talk.pdf(13 頁),以及錄影 Week 14 Tue.(約 77 分鐘)。Fall 2025 這一學期的存取等級是 A3 足以自學,評級定義見全球 AI/CS 課程地圖。

先講清楚兩個限制。第一,這支錄影沒有字幕,本文沒有逐段看片對時間軸,以下內容只根據投影片。第二,Reasoning 那份是二手整理:教授把 Denny Zhou 的演講整理成筆記,其中多張圖標著「Generated by NotebookLM」。要引用原始主張,請回到原演講(YouTube 標題為「Stanford CS25: V5 I Large Language Model Reasoning」)與論文。

一張時間軸:這門課從哪裡走到哪裡

Course_summary 的第二頁是一條 NLP 里程碑時間軸,和學期第一堂 Syllabus 裡用的是同一張圖。左端是 2000 年前後的 bag of words、vector space、TF-IDF 與 parsing tree,接著是 Bengio 的 neural probabilistic language model 與 2013 年 Google 的 word2vec。2018 年之後標為「Transformer Era」:GPT、BERT、GPT-2、GPT-3,最後是 2022–2024 年的 InstructGPT、ChatGPT 與 LLMs。

這張圖開學看,只是名詞清單。學期末再看,每個點都對得上一篇你讀過的內容。

三欄課程地圖,對回本系列

講課內容被收成三欄。下表照投影片的原始分欄,右側是本系列對應的篇目:

投影片欄位投影片列出的主題本系列
NLP FundamentalsText representation:one-hot、TF-IDF、Word2Vec第 1 篇 NLP 簡介與傳統文字處理、第 2 篇 詞向量與語言模型
NLP FundamentalsLanguage model:n-gram第 2 篇
NLP ModelsBasic models:RNN、LSTM第 2 篇、第 4 篇 Seq2seq 與 Attention
NLP ModelsCore models:Seq2seq、Attention、Transformer(self-attention、multi-head attention)第 4 篇、第 6 篇 Transformer
NLP ModelsPretrain language models:Encoder/Decoder、BERT、GPT、T5第 8 篇 BERT 家族
NLP ModelsSubword第 7 篇 Sub-word Tokenization
NLP AdvancesInstruct fine-tuning第 12 篇 GPT-3、InstructGPT 與 RLHF
NLP AdvancesPEFT:Prompt tuning、LoRA第 13 篇 PEFT
NLP AdvancesRAG:Sparse/Dense vector、Dual encoder、RAAT、Self-RAG第 14 篇 RAG 檢索器、第 15 篇 RAG QA 與進階

助教課另外收成兩欄。NLP Basics 是 Python(NumPy、Pandas、PyTorch)與 Hugging Face(BERT、GPT-2、T5),對應第 5 篇 PyTorch+HW2、第 9 篇 HF BERT+HW3 與第 11 篇 GPT-2/T5 摘要。NLP Advances 是 LLM API 與「有/沒有 LangChain 的 RAG」,對應第 16 篇 LLM API 與第 17 篇 RAG 實作+HW4。

有一格投影片沒列:解碼策略與 NLG 評估。那份講義在學期中確實教過,本系列放在第 10 篇。它和下面的 Reasoning 筆記關係最近,因為 CoT decoding 講的正是「不要只取 greedy 的那一條」。

怎麼做:拿這張表當期末自我檢查。每一列用一句話講出「它解決了前一列的什麼問題」,講不出來的那列就回去重讀對應篇。

投影片給的五個延伸方向

Course_summary 的「Future study」頁列了五塊,原文是條列,這裡照錄重點:

  • Advanced Applications of LLMs:MoE、GPT-4、ChatGPT 的架構與應用;把預訓練模型微調到特定領域。
  • Semantic Understanding and Logical Reasoning:用知識圖譜與符號推理加強推理;投影片在「改進語言理解與推論的新方法」後面括號寫 test-time scaling。
  • Multimodal NLP:CLIP、BLIP 這類整合文字與影像的模型,以及影片、音訊的語意理解與生成(VLM、VLA)。
  • Ethics and Societal Impact:模型偏誤與緩解、可解釋 AI(XAI)、能源效率。
  • Cutting-edge Technologies:RL 在 NLP 的應用如 RLHF、zero-shot 與 few-shot、長文生成的連貫性與控制,括號註明 lost in the middle。

站上已經有幾條可以接著走的路:多模態可以看 Stanford CS231N 導讀,test-time scaling 可以看李宏毅 ML 2026 的 HW8。

Reasoning 筆記:預訓練模型本來就會推理嗎

筆記的第三頁把問題擺出來:一般的看法是,預訓練 LLM 不經過 prompt engineering 或微調,就不會推理。第四頁給出演講的答案:預訓練 LLM 已經準備好推理,需要的只是解碼。 出處標的是 Wang 與 Zhou 的 Chain-of-Thought Reasoning Without Prompting(NeurIPS 2024)。

同一題,greedy 和其他候選差在哪

第五頁用一題小學算術示範:「我有 3 顆蘋果,爸爸比我多 2 顆,我們一共有幾顆?」

greedy decoding 第一個 token 取機率最高的「5」,答案是錯的 5 apples。如果第一個 token 改從其他候選開始,例如「I」或「You」,模型會自己寫出「爸爸有 5 顆,3+5=8」這段推理,得到正確的 8。以「The」開頭的那條則又回到錯的 5。

重點在這裡:推理路徑本來就在模型的輸出分布裡,只是不在機率最高的那條上。

CoT decoding 的兩步

第六頁把方法濃縮成兩步:

  1. 不只看 greedy 那一條,多檢查幾個生成候選。
  2. 從中挑出對最終答案信心最高的那條。

配圖把輸出空間畫成地形:機率最高的山峰是「5 apples」,另一條較低的路徑寫出「3+5=8」,終點的答案信心標 98%。這張圖是 NotebookLM 生成的示意,不是論文的實驗圖。

這和第 10 篇講的 beam search、top-k/top-p 是同一個問題的延伸:那時候問的是「生成的句子自不自然」,這裡問的是「答案對不對」。

Prompting 改的是輸出分布

第七頁把兩種常見的 CoT prompting 放在一起。few-shot chain-of-thought prompting 要先給一題有推理過程的範例,缺點是需要針對任務準備範例。在題目後面加一句「Let's think step by step」則是通用做法,投影片的評語是通用,但表現比 few-shot 差。

放在 CoT decoding 的脈絡下看,兩者都是在推移輸出分布,讓帶推理的路徑浮到前面。

SFT 模仿一條路,迭代微調探索多條路

第九頁對照兩種微調。SFT 的資料是人寫的解法,配圖描述成「模仿單一路徑」。另一邊投影片寫作「IO fine-tuning」,配圖是四步循環:

  1. 生成:讓模型對一批問題產生多個不同解法路徑。
  2. 驗證:用簡單的 verifier,例如檢查最終答案對不對,篩出答對的解法。
  3. 微調:拿這些機器生成、答案正確的「問題+解法」當新訓練資料。
  4. 重複:用變強的模型回到第一步。

同一頁用紅框寫了一句提醒:LLM 是被訓練來預測下一個 token 的機率模型,它們不是人。第八頁拿 Gemini 2.0 thinking mode(2024 年 12 月)解「用 1 到 10 各一次、只用加法和乘法湊出 2025」的思考過程,放在「LLM reasoning vs. human reasoning」的標題下,筆記沒有另外寫結論。

Self-consistency:只看答案,多數決

第十頁講 self-consistency,步驟寫得很直接:

  1. 用隨機取樣讓模型產生多條(例如 40 條)推理路徑。
  2. 完全忽略中間的推理步驟。
  3. 只看最終答案,選出現最多次的那個。

配圖是五條路徑分別答 8、8、5、8、9,投票後得到 8。角落另有一張 NotebookLM 生成的長條圖,標 PaLM 在 GSM8K 上從單一路徑 CoT 的 58% 升到加上 self-consistency 的 75%,約三成相對提升。這組數字請以原論文 Self-Consistency Improves Chain of Thought Reasoning in Language Models 為準;論文摘要寫的是 GSM8K 提升 17.9%。

Retrieval 還是 reasoning?兩個都要

第十一頁的答案是「Retrieval + Reasoning」。配圖的例子是計算一個四邊形的面積:先給一個檢索式提示「解題前,先回想一個相關的問題」,模型想起兩點距離公式,再用它算出各邊長,問題就解開了。

這裡的 retrieval 指的是讓模型先從自己的知識裡叫出相關問題,不是第 14 篇那種外接文件庫的檢索。兩者的共同點是:推理之前先把對的材料擺到眼前。

四條不等式

第十二頁把演講收成四行:

  • Reasoning > no reasoning
  • RL fine-tuning > SFT
  • Aggregating multiple answers > one answer
  • Retrieval + reasoning > reasoning only

旁邊的圖把推理能力畫成五個階段:潛在能力存在於預訓練模型中,透過解碼或提示被引出,透過 SFT 被固化(但結果脆弱),透過迭代微調被泛化,最後透過聚合與檢索被增幅。最後一頁是「Next-token prediction → emerging intelligence」,配上費曼的一句話:真相總是比你想的更簡單。

怎麼做:今晚用任何一個可以調 temperature 的模型 API,把第五頁那題蘋果問題跑 10 次,記下每次的最終答案再做多數決。接著把 temperature 設成 0 跑一次,比較兩種做法的答案。第 16 篇 LLM API 的 notebook 就有現成的呼叫程式可以改。

Fall 2026 的 Reasoning 單元還沒出來

Fall 2026 的 Syllabus-115 把「NLP issues in LLM era:Reasoning、Agentic AI」列成新的一塊,課表 W16 是「Reasoning / Agent」。截至 2026-09-30,repo 首頁課表只放到 W3,W16 那列的投影片與錄影欄都還是空的。2025 年這份 Reasoning 筆記是不是 2026 單元的前身,官方材料沒有說,本文不猜。改版的其他細節見下一篇。

延伸閱讀

以下站內文章各自講得更完整,這裡只放連結:

這一篇可以確認與不能確認的

可以確認:兩份投影片的文字與圖、W14 列掛的檔案與錄影 ID、錄影標題與長度、兩篇論文的標題與 arXiv 編號。不能確認:W14 錄影裡教授實際怎麼講、有沒有講到投影片以外的內容(錄影無字幕,未逐段看片);NotebookLM 配圖裡的數字是否精確對應原論文;Fall 2026 W16 的內容。

系列導覽:上一篇 RAG 助教課+HW4|下一篇 期末專題與 Fall 2026 改版|系列總覽

參考資料