Skip to content

Introduction to Deep Learning:光靠 prompt 走不遠的那兩個時刻

2026年8月16日 1 分鐘
TL;DR CS230 第一講是課程總覽,但 Andrew Ng 花最多時間講的是三件事:為什麼 scaling 有效、什麼時候 prompt 就不夠用了、以及他認為「不要學寫程式」是史上最糟的職涯建議之一。
目錄
  1. flipped classroom 為什麼這樣設計
  2. scaling:這門課的敘事起點
  3. 抽象層地圖
    1. 什麼資料型態能靠 prompt 走完
    2. 兩個把人推下去的觸發條件
  4. 線上課程的五個模組
    1. 調參那段的兩句話
    2. 專案策略那段(後面兩講的預告)
  5. AI 輔助寫程式
  6. 為什麼 ML 專案一定要「先做出來才知道」
  7. 職涯:這一講傳播最廣的一段
    1. 「不要學寫程式」
    2. 對 CS 新鮮人失業率上升的解讀
    3. 四級生產力排序
    4. 為什麼懂基礎才能控制工具
    5. 他面試 GenAI 職位會看的工具袋
  8. 問答裡的兩個實用答案
  9. 延伸:課堂之外
  10. 參考資料

🌏 English version

這是 Stanford CS230 導讀系列的第一篇。

先說清楚讀的是哪一輪:Stanford CS230 Deep Learning,2025 秋季,九支影片約 13 小時(playlist)。這一輪已經結束——最後一講 2025/12/02,影片 12/16 全部放完。Autumn 2026 已排定 2026/09/22 開課,會是另一個 playlist。每篇都會標上課日期。

另外:沒有 Lecture 7,11/4 是 Democracy Day 停課,講次跳號,本系列編號跟著跳。

本篇對應 Lecture 1: Introduction to Deep Learning(2025/09/23,Andrew Ng 主講,1 小時)。這一講是課程總覽,沒有數學,但 Ng 用了大半時間講他對產業與職涯的看法。

flipped classroom 為什麼這樣設計

CS230 的實體課不重複線上影片的內容。Ng 的理由:

「很多 Stanford 學生本來就會自己去看線上影片。與其我們年復一年講同一堂課,不如把影片做到最好放線上,把教室時間留給更豐富、更深入的討論。」

課表排兩小時,實際只用約 1 小時 20 分。整學期的實體課因此是「線上影片沒深入處理的進階題目」加上業界客座——這也解釋了為什麼後面幾講的主題會逐年更換。

scaling:這門課的敘事起點

Ng 在白板上畫的第一張圖:橫軸資料量、縱軸效能。

  • 傳統機器學習(logistic regression、決策樹)給再多資料都會 plateau。他用語音辨識舉例:舊世代演算法就算餵到幾萬小時的語音,準確率還是會停住,「就像它們不知道拿這麼多資料要幹嘛」。
  • 小型神經網路會往上走,中型更高,大型持續往上。

「deep learning 主宰 AI 這十到十五年的原因,是我們有一套訓練超大神經網路的配方(recipe),可以把大量資料塞進去,得到超乎尋常的效能。」

接著是可預測性:先有百度的論文顯示 scale 上去的效能增益是可預測的,之後 OpenAI 用 scaling laws 那篇把這個想法普及化。而正是這個可預測性推動了資料中心的投資——你可以事先估算「買這麼多 GPU、投這麼多算力和資料,效能會到哪裡」。

他順帶講了一個趣聞(屬講者口述,未經查證):他第一台用來訓練神經網路的 GPU 機器,是一位 Stanford 大學部學生在宿舍組的,那個人叫 Ian Goodfellow。他講這個是為了帶出一句話:「有時候你在宿舍或實驗室做的事,回頭看幾年,真的可能產生巨大影響。」

抽象層地圖

CS 基礎 → 機器學習 → 深度學習 → 生成式 AI(transformer)

每一層都建立在下一層上。Ng 對最底層的看法很直接:

「就算你用 Claude Code、Gemini CLI、Codex、Cursor 或 Windsurf,懂 CS 基礎的人東西就是做得比較好,而不是『我來 vibe code 一下』。」

這門課的定位:把你帶到 deep learning 的近專家水準,往下沾一點機器學習(目標函數、最佳化技巧),往上碰一點生成式 AI(transformer 架構)。

然後是這一講最被引用的一句:

「我天天用 LLM,但光靠 prompt 是不夠的——很多東西我沒辦法只靠 prompt 做出來,所以常常得往下鑽一層,去動 deep learning 的東西。」

什麼資料型態能靠 prompt 走完

資料型態實務上會怎麼做
文字prompt 就能走很遠,大量應用是純 prompt 建的
音訊常常直接動 deep learning
影像 / 影片常常直接動 deep learning
結構化資料(大表格)常常直接動 deep learning

理由不神秘:生成式 AI 是從「文字進、文字出」長出來的。多模態一直在補,但越往非文字走,越早撞到那條線

兩個把人推下去的觸發條件

第一個:調不動。 「我參與過不少團隊,調了一個月的 prompt,效能就是上不去。」

第二個:帳單。

「原型期用 GenAI 工具相對便宜,每百萬 token 幾塊美金,你可以做很多事。但有時候你夠幸運,做的產品找到了 product-market fit,一堆使用者開始用——然後你團隊會『驚喜地』發現,你的 AI 帳單開始暴漲。」

他說他們付給 LLM 供應商的錢「遠超過我想付的數字」。然後:

「知道怎麼用 deep learning 去 fine-tune 比較小的模型——那才是真正把成本曲線壓回去的關鍵技能。」

這裡要先埋一個伏筆:本系列 Lecture 8 的 Kian Katanforoosh 會用整段時間論證「盡可能避開 fine-tuning」。兩人講的其實是同一件事的兩端——成功之前別碰,成功之後你逃不掉——而觸發它的不是技術品味,是財務。

線上課程的五個模組

實體課不重複的那部分,長這樣:

  1. 神經網路與深度學習基礎——用純 Python 手刻。Ng 的理由是 TensorFlow / PyTorch 會把細節藏起來。
  2. 調參(hyperparameter tuning)
  3. 機器學習專案策略
  4. 卷積網路(CNN)——電腦視覺
  5. 序列模型——時間序列與文字,含 transformer

調參那段的兩句話

「我認識的每一個後來變得很強的博士生,都在某個時間點凌晨兩點在調超參數。

「有些晚上,我調參的技術好不好,差別就是三點回家睡 vs 七點回家睡。」

(他自己補了一句:別學我,我不是在鼓勵這種行為。)

專案策略那段(後面兩講的預告)

例子是人臉辨識開門系統。相機、去背、切臉、註冊、比對、要不要再拍一張防照片攻擊——決策點很多。

「經驗不足的團隊常常幾乎是隨機挑事情做:讀到一篇論文說要更多資料,就花六個月去收資料。但很多時候收更多資料對你的應用根本沒幫助。」

他舉了一個反例:某家族企業的 CTO 買了一大堆 GPU,然後指著他還在念大學部的姪子說「我姪子懂 AI,我把這筆預算交給他」。

「有紀律的開發流程,是速度上十倍差距的來源。我看過團隊花六到十個月走一條有經驗的工程師六個月前就能告訴他們走不通的路。」

這條線會在 Lecture 3 和 Lecture 6 變成兩整堂課。

AI 輔助寫程式

現場舉手:幾乎全班都在用。

「我個人希望這輩子再也不要回去手刻程式。」

(他說有次在咖啡店看到旁邊的人手刻程式,禮貌地問了才知道是別校的作業。)

他把軟體工作分成兩個 bucket:quick and dirty 的原型,以及 production-grade 的軟體。AI 輔助對原型的幫助最大。

他也給了反例,而且是當天早上發生的:一位合作者用某個 agent coder,database migration 出錯,把資料庫紀錄全清掉了——所幸是只有五個使用者的測試應用。所以他對 production 的用法比較小心。

沙盒論點(這段對「AI 安全該怎麼做」有實務意義):

「如果你的原型只跑在自己的筆電上、不碰敏感資訊,那安全需求就可以低一點——除非你打算惡意入侵你自己的筆電。

在沙盒裡就能暫時不管擴展性、安全、可靠性,決策快很多。

關於失敗的成本

「我知道很多團隊在為『概念驗證進不了 production』焦慮。我的看法不同。如果一個 PoC 夠便宜,做 20 個又何妨?那就是找到那一兩個真正有用的東西的代價。

關於「move fast and break things」

「有些團隊從那句話學到的是不要快,我覺得那是錯的。我說的是 move fast and be responsible

我認識最負責任的團隊,往往也是跑最快的團隊——因為快才能真的把東西做出來、才會知道資料裡有什麼、使用者要什麼,而那才是找出哪裡會出錯的最好方法。

為什麼 ML 專案一定要「先做出來才知道」

「你 100% 控制你的程式碼,但你不控制資料。」

他做過那麼多次語音辨識,到現在還是會被資料嚇到:某種口音比預期多、有人講話特別快、車上背景噪音很大。最近一個案子讓他意外的是背景說話的人數——使用者對系統講話、轉頭跟旁邊的人講話、再轉回來,系統就混亂了。

同一套邏輯他直接套到 LLM 上:

「關於 LLM 難以控制,有很多過度的炒作、有點在製造恐懼。我們之所以事先不知道 LLM 會怎麼表現,是因為它訓練在多到沒有任何人類看得完的資料上——我們沒辦法真的去看那幾十兆 token 裡有什麼。」

所以打造 agent 應用同樣是經驗性的:做出來,看哪裡好、哪裡爛,再拿這個去修。

職涯:這一講傳播最廣的一段

「不要學寫程式」

這是史上最糟的職涯建議之一。

理由:coding 變簡單時,該有更多人寫程式,不是更少。

  • 打孔卡 → 鍵盤終端機:更多人學寫程式
  • 組合語言 → 高階語言:更多人學寫程式
  • 他去翻了 COBOL 剛發明時的文章,當年真的有人寫「有 COBOL 了,程式這麼好寫,還需要程式設計師嗎?」

對 CS 新鮮人失業率上升的解讀

他的說法不是「AI 取代了」,而是:

「很多學校的課綱從 2002 年以來幾乎沒變……而我今天不會雇用一個不會用 AI 輔助寫程式的軟體工程師,就像我不會雇用一個用打孔卡而不用鍵盤的人。

他講了一個親身案例:前後面試兩個人,一個還沒畢業但很懂 GenAI 工具鏈,一個十年全端經驗但技能組跟 2002 年一樣、完全沒碰 AI 輔助。他選了那個還沒畢業的。

四級生產力排序

被追問「業界不是說寧可要十年經驗的人嗎」,他給了一個更完整的排序(並強調對個人毫無不敬之意):

  1. 沒經驗、不懂 AI
  2. 十年經驗、不懂 AI
  3. 應屆畢業、懂 AI
  4. 十年經驗、又懂 AI ← 最強

「兩個因素之間,真的懂 AI 很重要,但經驗也很重要。我認識最好的開發者是那些非常有經驗、同時又非常掌握最新 AI 技術的人。」

為什麼懂基礎才能控制工具

他用了一個非技術的類比:做線上課程時需要背景圖,合作者 Tommy Nelson 懂藝術史,能用流派、靈感來源、色盤的語言去 prompt Midjourney,生出很漂亮的圖;Ng 只會打「請給我漂亮的機器人圖」,永遠拿不到那種控制力。最後整套素材都用對方的。

「未來最重要的技能之一,是懂電腦與 AI 怎麼運作,才能用 AI 的語言精確告訴電腦你要什麼。」

他面試 GenAI 職位會看的工具袋

RAG、向量資料庫、evals 與 error analysis、guardrails、知識圖譜介接、multimodal、fine-tuning、agentic workflows——加上 AI 輔助寫程式

(他也補了一句:「很多雇主自己還沒搞懂怎麼面試。一家公司如果沒有人懂 GenAI,他們要怎麼知道該怎麼考?」)

問答裡的兩個實用答案

要多少資料才夠? 很難知道。做過或文獻有的題目有 gut sense——例如從零訓練人臉辨識,五萬張不重複的臉算不錯。全新題目(沒人收過的新醫材血液資料)就先收一點、先訓一個模型,用它的成敗校準需求。「有時候一百筆就夠,有時候一千億筆還在要更多。」

CS129 / CS229 / CS230 怎麼選? 129 是最容易的入門坡道;229 數學理論重、步調快、涵蓋面廣(監督/非監督/決策樹/boosting/k-means);230 最應用、只做 deep learning、幾乎不做證明。229 與 230 重疊刻意做得很低,可同時修。


延伸:課堂之外

這門課的大綱正在漂移。 我拿 Wayback 上 2024 秋季的 syllabus 對照過:

2024 秋2025 秋
L2 Full-cycle of a DL Project(無投影片)L2 自監督/弱監督學習(全新投影片)
L4 Deep Learning Intuition整堂拿掉
L9 RAG and AI Agents(一行標題,無投影片)L8 Beyond the model(110 分鐘完整一講)
L10 結業致詞(沿用 fall_2021 投影片L10 可解釋性(全新投影片)

方向很清楚:LLM 與 agent 的內容從附註膨脹成主課,基礎理論被壓縮,並新增了一整講「打開模型看裡面」。 那個 L10 特別有意思——舊版的結業致詞用的是 2021 年的投影片,連續沿用三年沒動。

官網 syllabus 的 Lecture 6 條目到現在還是過期的:上面寫「職涯建議/論文閱讀/醫療 AI 客座」配 2024 年的投影片,但那天實際錄下來的整堂課是 AI Project Strategy。職涯是 Lecture 9。照官網找會找錯。

參考資料