Skip to content

政大蔡炎龍 生成式AI L14:文字模型與圖像模型互搶地盤——生成式 AI 新趨勢與期末專案

2026年9月30日1 分鐘
TL;DR最後一講看的是兩條技術線開始互相越界:ChatGPT 這類 LLM 開始畫圖,投影片用 early fusion 和 VQ-VAE/VQGAN 解釋「把圖像切成 token」怎麼做;反過來,Inception Labs 的 Mercury 用 diffusion 生成文字,把一句話加噪成一排 [MASK] 再還原。接著是幾篇人人都用得上的研究:怎麼自動評 RAG、推理模型更容易被劫持、DeepMind 的四種 AI 風險。最後是 Vibe Coding 與一串應用工具,以及用 Gather Town 線上研討會進行的期末專案。

🌏 English version

本文依據政大蔡炎龍「生成式 AI:文字與圖像生成的原理與實務」2025 春季(政大學期代碼 1132)版。 這是政大蔡炎龍 生成式AI 導讀系列第 14 篇,也是最後一講,接續 L13 強化學習與生成式 AI 綜合應用。

用到的官方材料有四份:第 14 講錄影(2025-05-27,3 小時 9 分)、投影片 GenAI14 生成式 AI 新趨勢(60 頁)、長庚衛星班課程頁的課表與期末專案說明,以及 Fall 2026(1151)課綱的第 15、16 週與評分說明。

存取等級是 A3,但這一講有兩個缺口要先講清楚。一是錄影的後半段有現場技術問題,影片說明直接寫「後半段請參考投影片」,並附上各段對應的投影片頁數。二是期末專案只有規則公開,1132 的成果清單沒有公開。

本週在課程中的位置

長庚衛星班的課表上,這一講排在第 15 週(5/27);第 14 週(5/20)是政大校慶,停課。它沒有作業,下一週(6/3)就是期末專題成果分享。

整門課前半講文字生成(L04–L09),後半講圖像生成(L10–L12)。L14 回頭看這兩條線,發現它們開始互相攻佔對方的地盤。Fall 2026 課綱把這一週的主題寫得更直白:文字生成是預測 token 的模型,圖像生成是 diffusion models,兩者有「互相攻佔」對方地盤的現象,要探討其中的原理,以及可能走向這個方向的原因。

投影片分四部分:LLM 開始生圖?(第 2–21 頁)、Diffusion Model 也來文字生成!?(第 22–31 頁)、新進人人都可用的研究(第 32–40 頁)、生成式 AI 的應用(第 41–60 頁)。

LLM 開始生圖?

現象:ChatGPT 跨到圖像生成

投影片先放了一串例子:把照片轉成吉卜力風格、把一台 Nikon F 做成小模型拿在手上、把課程吉祥物「DIVE」轉成 3D 卡通、用一大段 prompt 描述一間像外帶咖啡杯的 Q 版咖啡館。重點是 prompt 可以寫得很精確,角色、漫畫風格都能指定。而且不只 ChatGPT,投影片也放了 Gemini、Grok、Mistral Le Chat 生的圖。

原理:把圖像當成一種「語言」

接著老師回頭複習 LLM 的原理(L04–L05):tokenizer 把文字換成一串編號,經過 embedding layer,再進 transformer。英文常見的切法是 BPE(Byte Pair Encoding):一個字元一個字元切會讓序列太長,一個詞一個詞切又會讓 token 數太多。想看實際切法,可以試 OpenAI 的 tokenizer 頁面,不同世代的 ChatGPT 切法也不一樣。

那圖像怎麼進 LLM?投影片的答案是 early fusion:把圖像當成一種「語言」,圖像 token 和文字 token 一起送進同一個 transformer。問題變成:圖像的 tokenizer 怎麼做?

投影片介紹的一種方式是 VQ-VAE:

  1. 它是一種 VAE,有 encoder、latent vector、decoder(L10 講過)
  2. 不同的是,latent vector 只有有限個選擇:一本碼本 e₁, e₂, …, e_K
  3. 圖像一塊一塊找最接近的碼本向量,整張圖就變成一串編號,例如 37、5、76、12……

再加上 GAN 的鑑別器(L03 講過)提升畫質,就是 VQGAN。有了這套 tokenizer,transformer 就能像文字生成一樣預測下一個 token,最後再由 generator 把預測出來的 token 畫成圖。

要注意的是,投影片講的是「LLM 有可能這樣生圖」的原理,沒有說 ChatGPT 實際用的是哪一種架構。

Diffusion Model 也來文字生成!?

反方向的越界是 Inception Labs 的 Mercury:用 diffusion model 生成文字。投影片的觀察是它目前比較專注在程式生成上,並附上試用網址 chat.inceptionlabs.ai。

先回憶 L11 的圖像 diffusion:一張清楚的照片一步步加上高斯雜訊,直到完全是雜訊;生成時再一步步還原。

文字怎麼加噪?投影片用一句話示範,每一步把一個字換成 [MASK]:

炎龍老師很好笑
→ 炎龍老師很[MASK]
→ 炎龍老師[MASK][MASK]
→ 炎龍[MASK][MASK][MASK]
→ [MASK][MASK][MASK][MASK]

還原就是去噪。給 prompt「炎龍老師很」,[MASK] 可能還原成「可愛」「好笑」或「白痴」。投影片特別提醒:這不是單純的填字遊戲。

Diffusion LLM 有兩個特性:快速、一次生成;全盤考量,不是一字一字生。Mercury 出來後引發一陣討論,但一開始的反應是「LLM 這麼厲害,誰理你呢?」後來大家發現「傳統」LLM 也會畫圖了,轉機出現在 Google 宣布要推出 Gemini Diffusion。錄影 1:31:37 另外提到一個開源的多模態 diffusion LLM「Dimple」,投影片上沒有。

想看 Mercury 的技術細節

Inception Labs 在 2025 年 6 月發表了技術報告 Mercury: Ultra-Fast Language Models Based on Diffusion,時間在這堂課之後。Diffusion LLM 的訓練目標與平行解碼的代價,站內 CME295 第 8 講有完整推導。

新進人人都可用的研究

第三部分是幾篇 2025 年上半的論文。錄影這段因為技術問題,影片說明改成標注投影片頁數,建議直接對照投影片看。

自動幫你的 RAG 評分(第 33–34 頁):引用 Can LLMs Be Trusted for Evaluating RAG Systems?,整理出 4 種讓 AI 自動評分的方法:

方法做法
讓 LLM 來打分數直接給一個分數,例如 3.5 分
PK 對戰評分兩個答案比較哪個好
CoT 思維鏈先一步步檢查,再下結論
查驗是否有依據檢查答案裡的句子有沒有出現在檢索出的資料中

投影片同時提醒:自動評價不該當唯一標準。

推理能力強,也是個危機?(第 35 頁):引用 H-CoT(劫持思維鏈)。投影片的摘要是:本來沒有「思考」的模型,98% 會正確拒絕回覆犯罪策略等請求;加上思考的模型被 H-CoT 攻擊後,只有 2% 會拒絕。

其他三篇(第 36–38 頁):AI 說服與被說服的綜述(arXiv 2505.07775,投影片寫的標題是 Systematic Survey,arXiv 目前的標題是 A Comprehensive Survey of Computational Persuasion);CoT 強化推理,但讓 LLM 遵從指令的程度下降;以及 Anthropic 和 xAI 公開的 Claude、Grok system prompt。

DeepMind 的 AI 四種風險(第 39–40 頁):引用 DeepMind 2025 年 4 月的文章 Taking a responsible path to AGI:

風險投影片寫的主因
濫用人類有惡意:叫 AI 去做傷害人的事
錯誤對齊AI 和人類價值不一致:AI 自己去做(傷害人的)事
錯誤世界很複雜,出了沒想到的 bug:AI 犯了不是故意的錯
結構性風險多個 AI Agents 與人類交互,產生結構性問題:每個 AI 都「做正確的事」,合起來卻出錯

生成式 AI 的應用:Vibe Coding 與一串工具

最後一部分(第 41–60 頁)跟 L13 投影片的第三部分內容幾乎相同。L13 的錄影從 1:54:30 起講這段,L14 錄影則在 1:16:05 用 HTML、CSS、JavaScript 現場示範。

Vibe Coding

2025 年 2 月,Andrej Karpathy 在 X 上的貼文創了 Vibe Coding 這個詞。投影片把他描述的做法整理成五行:

  • 對 LLM 說「把 sidebar padding 減半」
  • 它改好了,直接接受(懶得找程式碼)
  • 出錯?把錯誤訊息貼給它,它自己會修
  • bug 修不好?亂改幾次就會好
  • 最後整個專案怎麼完成的,其實不太知道

投影片也引了 Merriam-Webster 的定義:告訴 AI 你想要什麼,讓它替你寫程式;程式設計師不需要理解程式碼怎麼運作,而且通常得接受一定數量的錯誤。中文譯名投影片列了一排:隨興程式設計法、擺爛程式設計法、耍廢式程式設計、直覺流程式設計,直譯是「氛圍程式設計」。

工具部分列了 Windsurf、Cursor、Canva,示範題目是「設計一個 Web App 計算機」。

其他應用工具

工具投影片示範的用法
Google Labs: Little Language Lessons寫一個情境,自動產生語言課程、例句和小用法重點
NotebookLM丟進介紹 RAG/AI Agent 的投影片,生成 podcast
Perplexity、Felo以會上網著稱的「搜尋派」,先拆解問題再搜尋;可以想成一種 AI Agent,Perplexity 能切換模型、做 Deep Research,Felo 能產生互動網頁
Napkin AI快速把想法視覺化,一次給好幾種圖讓你選
Suno會作曲的 AI;投影片示範先讓 ChatGPT 寫一首推廣本課的 K-Pop 風格歌詞,再交給 Suno 作曲

投影片也提到 Claude、Grok、Le Chat、ChatGPT、Gemini 現在都會上網,「搜尋派」的 Perplexity 也漸漸往全方位發展。

期末專案:Gather Town 線上研討會

這門課的期末專案規則有兩份公開版本。

1132 長庚衛星班頁面的說明:蔡炎龍老師的規劃是每個人完成一個生成式 AI 應用專案,以 Gather Town 的線上研討會模式呈現。同學以投稿方式參與,獲選的同學參加期末專案分享,並有額外加分。原規劃的繳交日期是 6/2。長庚班因為九成是大四生、學期成績要在 5/29 前上傳,協同教師把期末專案配分從 20% 改成 0%。第 12 講錄影 17:30 有一段「期末展演說明」、2:19:32 有「期末專案繳交說明」,可以聽到主講者當時的口頭說明。

Fall 2026(1151)課綱寫得更完整:

  • 期末專案占 20%,每個人都要完成一個生成式 AI 應用專案
  • 期末分享採 Gather.town 線上研討會模式,排在第 16 週(2026/12/22)
  • 主導課程以學生投稿、擇優的方式選出分享者,獲選者有額外加分
  • 衛星課程的協同老師可以自訂參與規則,例如是否所有同學都要分享
  • 參與分享的同學要錄一段簡報影片,最好兩、三分鐘,不超過 5 分鐘;其他會眾走到簡報處就能看到影片,不需要自己重複介紹
  • 協同老師也可以規定參與方式,例如至少看十個各校同學的簡報、選出最好的三個並分享原因

1132 的期末成果清單沒有公開,本系列不寫。

自學的話:拿 L13 的提案當起點,照 1151 課綱的規格做一支 3 分鐘以內的 Demo 影片。規格本身就是很好的限制:3 分鐘講不完的專案,通常是範圍太大。

自學檢查點

  1. 為什麼 LLM 要生圖,得先有一個「圖像的 tokenizer」?
  2. VQ-VAE 跟 L10 的一般 VAE,差在哪裡?
  3. 文字的 diffusion 用什麼當「雜訊」?為什麼投影片說它不是單純的填字遊戲?
  4. 投影片列的 4 種 RAG 自動評分方法裡,哪一種最直接對應「降低幻覺」?
  5. DeepMind 的四種風險裡,「錯誤」和「錯誤對齊」的差別是什麼?
參考答案
  1. transformer 只處理一串 token 編號。圖像要先變成一串編號,才能跟文字 token 一起送進去,也才能「預測下一個 token」。
  2. 一般 VAE 的 latent vector 是連續的,VQ-VAE 的 latent 只能從有限個碼本向量裡挑,所以每一塊圖像都能對應到一個整數編號。
  3. 用 [MASK] 取代原本的字。去噪時模型一次考量整段,不是只看前文把空格填上,而且可以一次還原多個位置。
  4. 「查驗是否有依據」:檢查答案的內容有沒有出現在檢索出的資料中。
  5. 「錯誤」是 AI 無意間犯錯,主因是世界太複雜;「錯誤對齊」是 AI 的價值跟人類不一致,自己去做了傷害人的事。

延伸閱讀

本篇自己講完整,想往下挖再看這些:

系列導覽:系列總覽|上一篇 L13 強化學習與生成式 AI 綜合應用|本篇是系列最後一篇

參考資料