Skip to content
所有標籤

#machine-learning

171 篇文章

台大 ADL 2025 第 1 講:什麼是機器學習與深度學習

ADL Fall 2025 的第一份自學講義把機器學習講成「從資料裡找一個函數」,把深度學習講成「一條由很多簡單函數串起來、每一站都由機器自己學的生產線」。它用語音與影像說明 deep 和 shallow 的差別,用大數據與 GPU 解釋 2010 年後的突破,再用 universality theorem 追問為什麼要深而不是胖。最後一段最實用:學習任務由輸出領域決定,網路架構要配合輸入領域的性質。

林軒田機器學習技法 T7–T8:Blending、Bagging 與 AdaBoost

技法第 7、8 講是 aggregation 模型的入口。T7 先把「組合多個假說」排成 uniform、linear、any(stacking)三種 blending,用一行代數證明 uniform blending 降低的是 variance,再用 bootstrap 在手上唯一一份資料裡造出多樣的 g_t,就是 bagging。T8 把 bootstrap 重新解讀成「替樣本加權」,改成專挑上一輪答錯的樣本加重,讓下一個假說被迫不同,再用 α_t = ln √((1−ε_t)/ε_t) 當投票權,這就是 AdaBoost。練習用 Fall 2024 HW6 Q4、Q9 與 HW7 的 bootstrap、AdaBoost 證明題和 madelon 上 500 輪的 AdaBoost-Stump 實驗;沒有官方解答。

林軒田機器學習基石與技法導讀:總覽與自學路線

林軒田的機器學習基石(16 講)與技法(16 講)是兩門中文 MOOC,130 支 YouTube 影片與 32 份投影片全部免費。只看 MOOC 是 A2:Coursera 自 2025 年 8 月起只讓免費帳號看第一單元,練習題被擋在付費牆後。補上 Fall 2024 課程頁公開的 HW0–HW7 與期末專題說明,就能到 A3,只差評分鏈:沒有官方解答,Gradescope 與 NTU COOL 限修課生,Kaggle 競賽頁回傳 404。Fall 2026 正在進行,是翻轉教室,第 4 週以前的投影片與 hw0、hw1 已公開。

林軒田機器學習技法 T9–T11:決策樹、隨機森林與梯度提升樹

技法第 9–11 講用「樹+aggregation」一條線串起三種模型。T9 把決策樹看成 conditional aggregation,講 C&RT 的二元分支、Gini 與迴歸誤差、剪枝、類別特徵與 surrogate branch。T10 把 bagging 套在完全長大的樹上,加上隨機子空間與隨機投影就是隨機森林,順帶得到免費的 OOB 驗證與 permutation 特徵重要度。T11 先把 AdaBoost 重新推導成對指數誤差做函數空間的最速下降,再把誤差換成平方誤差,得到「對殘差做迴歸」的 GBDT。練習用 Fall 2024 HW7 的 impurity、gradient boosting 證明題;沒有官方解答。

林軒田機器學習基石導讀:學習可行嗎?Hoeffding 與「出了資料之外」

基石 Lecture 4 先證明學習「不可能」:只看資料 D,D 以外的答案怎麼猜都可能被說錯,這是 No Free Lunch。接著用抽彈珠換個問法:如果資料是從同一個分布獨立抽出來的,Hoeffding 不等式保證樣本錯誤率 E_in 很可能接近真實錯誤率 E_out。只驗證一個固定的 h 不算學習;演算法要從 M 個假說裡挑,就得用 union bound 付出 2M exp(−2ε²N) 的代價。結論:假說集合有限、E_in 又小,學習就可行。M 無限大怎麼辦,留給下一講。

林軒田機器學習技法 T16 Finale:整門課收成三類技巧,再用 Fall 2024 投影片補上現代深度學習

技法 T16 把整門課重新分類成三類技巧:怎麼利用特徵(kernel、aggregation、extraction、低維壓縮)、怎麼最佳化(梯度、等價問題、拆成多步)、怎麼防過擬合(正則化、驗證),最後用四屆 KDD Cup 冠軍模型說明這些技巧在實務上怎麼組合。MOOC 錄於 2016 年,深度學習只講到 pre-training;Fall 2024 校內課用 302u(ReLU 家族、Xavier/He 初始化)、303u(momentum、RMSProp、Adam)、一場 2020 年的演講投影片 mlmai.ics 與 11 個模型的 1126 總整理補上。Fall 2026 同一批投影片排在 W16,目前還是 404。

林軒田機器學習基石作業導讀:Fall 2024 HW0–HW5 練什麼、要什麼資料,附 Fall 2026 hw0/hw1

Fall 2024 的基石作業共六份:HW0 是 20 題數學先修選擇題;HW1–HW5 每份 12 題加 1 題 bonus,Q1–4 自動批改、Q5–12 助教批改,程式題用 LIBSVM 網站上的 rcv1、cpusmall、mnist 資料,HW5 要用 LIBLINEAR。HW1、HW2 各有一題要你拿 ChatGPT 類工具的回答來反駁。Fall 2026 已公開 hw0 與 hw1:hw1 改成 16 題全選擇題、抽 4 題由助教細改,資料換成課程自己給的 hw1_train.dat;新 policy 允許用 AI 與 vibe coding,但 AI 產生的程式要逐段用自己的話寫註解。兩個學期都沒有公開官方解答。

林軒田機器學習技法 T5–T6:Kernel 邏輯迴歸與支援向量迴歸——SVM 其實是正則化模型

技法第 5 講把 soft-margin SVM 改寫成無限制形式:½wᵀw 加上 C 乘以 hinge 誤差的總和,也就是一個 L2 正則化模型,C 越大正則化越弱。hinge 誤差和邏輯迴歸的 cross-entropy 都是 0/1 誤差的凸上界,所以 SVM 近似於 L2 正則化邏輯迴歸。要機率輸出,可以用 Platt 的兩層學習在 SVM 分數上再跑一次邏輯迴歸,或靠 representer theorem 直接做 kernel 邏輯迴歸。第 6 講用同一個定理得到 kernel ridge regression 的解析解 β = (λI + K)⁻¹y,但 β 是稠密的;改用 ε-insensitive 的管狀誤差,就得到係數稀疏的 SVR。Fall 2026 沒有排這兩講。

林軒田機器學習技法 T3–T4:Kernel 技巧與軟邊界 SVM——無限維的分類器怎麼算、怎麼防過擬合

技法第 3 講把「特徵轉換+內積」合成一個 kernel 函數 K(x, x′),對偶 SVM 的訓練與預測都只要算 K,於是 d̃ 可以是無限大:Gaussian kernel 就對應一個無限維的轉換。第 4 講承認 SVM 仍會過擬合,引入違反量 ξₙ 與參數 C,得到 soft-margin SVM;它的對偶和 hard-margin 只差一件事:αₙ 多了上界 C。αₙ 的值把資料分成非支援向量、free SV 與 bounded SV 三類,而支援向量的比例 #SV/N 是 leave-one-out 誤差的上界,可以拿來快速排除危險的 (C, γ)。

林軒田機器學習基石導讀:學習問題、PLA 與學習的種類

基石前三講先把「機器學習」定義成一張流程圖:未知的目標函數 f 產生資料 D,演算法 A 從假說集合 H 挑出 g,希望 g ≈ f。接著用最簡單的 H(感知器)與 A(PLA)示範這張圖怎麼跑:資料線性可分時,PLA 的更新次數有 R²/ρ² 的上限;不可分時改用 pocket。第三講把學習問題依輸出、標籤、protocol、輸入四個軸分類,基石的主場是批次、監督式、具體特徵的二元分類或迴歸。練習用 Fall 2024 HW1 與 Fall 2026 hw1。

林軒田機器學習基石 L11–L12:線性分類模型、SGD、多類別與非線性轉換

基石 L11 把 PLA、線性迴歸、邏輯迴歸放在同一個分數 s = wᵀx 上比較:三者只差在誤差函數,而 scaled cross-entropy 是 0/1 誤差的上界,所以兩種迴歸都能拿來做分類。接著用「隨機挑一筆算梯度」把邏輯迴歸變成 SGD,並用 OVA、OVO 把二元分類器組成多類別分類器。L12 用特徵轉換 Φ 把圓形邊界變成 Z 空間裡的直線,代價是計算量與 d_vc 都跟著維度變大,所以結論是「先試線性模型」。練習題在 Fall 2024 HW4。

林軒田機器學習技法 T1–T2:線性 SVM 與對偶 SVM——最胖的分隔線、QP 與 KKT

技法第 1 講把「哪條分隔線最好」寫成最佳化問題:在 min yₙ(wᵀxₙ+b)=1 的縮放下,最大 margin 等於最小化 ½wᵀw,這是一個標準 QP。第 2 講用拉格朗日對偶把 d̃+1 個變數的 QP 換成 N 個變數、N+1 個限制的 QP,再用 KKT 條件從 α 解回 (b, w):只有 αₙ>0 的點,也就是支援向量,會影響答案。對偶問題還留著 zₙᵀzₘ 這個內積,所以要等下一講的 kernel 才算真正擺脫維度。

林軒田機器學習基石 L9–L10:從線性迴歸的閉式解,走到邏輯迴歸的梯度下降

線性迴歸把平方誤差寫成 (1/N)‖Xw − y‖²,梯度設為零就得到 w_LIN = X†y,一步算完。hat matrix H = XX† 把 y 投影到 X 的欄空間,由此推出平均而言 E_out − E_in ≈ 2(d+1)/N。邏輯迴歸用 θ(wᵀx) 估計 P(+1|x),由最大概似推出 cross-entropy 誤差 ln(1 + exp(−y wᵀx));它沒有閉式解,只能沿著 −∇E_in 一步步往下走,這就是梯度下降。

林軒田機器學習技法 T12–T13:神經網路與深度學習(autoencoder、PCA)

技法第 12、13 講開啟第三段「萃取隱藏特徵」。T12 從「perceptron 的線性組合」出發:兩層就能做 AND、OR,但做不出 XOR,多疊一層才行,這就是多層感知器;接著用 tanh 取代 sign、推導 backprop,再講非凸最佳化、d_vc = O(VD)、weight elimination 與 early stopping。T13 談 deep NN 的挑戰,把 autoencoder 當成「保留資訊的編碼」做逐層預訓練,把 denoising 當成正則化,最後證明線性 autoencoder 的最佳解就是 XᵀX 的前幾個特徵向量,也就是 PCA。這兩講錄於 2016 年,現代 DL 的補充在 Fall 2024 的 302u/303u。練習:Fall 2024 HW7 Q4、Q9 與 bonus Q13。

林軒田機器學習基石 L13–L14:過擬合與正則化

基石 L13 把過擬合定義成「E_in 更低、E_out 卻更高」,並用實驗找出四個成因:資料太少、隨機雜訊、目標函數太複雜(deterministic noise),以及模型太強。L14 的對策是正則化:把「退回 H₂」改寫成 ‖w‖² ≤ C 的限制,再用拉格朗日乘數變成最小化 E_in + (λ/N)wᵀw,這就是 weight decay。接回 VC 理論時,正則化讓有效 VC 維度 d_EFF 變小;L1 則換來稀疏解。練習題在 Fall 2024 HW4 Q8–9 與 HW5 Q1、Q5–6、Q10。

林軒田機器學習技法 T14–T15:RBF 網路、k-means 與矩陣分解——萃取模型還能長什麼樣

技法 T14 把 Gaussian SVM 重新看成「以距離為相似度的線性投票」,由此得到 RBF 網路;中心點太多會過擬合,於是用 k-means 找少量代表點,k-means 本身是交替最佳化。T15 從 Netflix 評分資料出發,把使用者 ID 做 one-hot 編碼、丟進去掉 tanh 的線性網路,得到矩陣分解 R ≈ VᵀW,用交替最小平方或 SGD 來學,最後把 boosting、NN、RBF 網路、矩陣分解、k-NN 收成一張萃取模型地圖。這兩講只有 MOOC 教材:Fall 2024 與 Fall 2026 的課程計畫都沒排,也沒有公開作業題。

林軒田機器學習技法作業與期末專題:Fall 2024 HW6–HW7 與 HTMLB 勝負預測

Fall 2024 技法段有兩份作業和一個期末專題,題目 PDF 都公開。HW6 練 kernel、soft-margin SVM 與 aggregation,程式題用 LIBSVM 在 mnist.scale 的 3 對 7 子問題上數支援向量、算 margin、跑 128 次 validation。HW7 練 bootstrap、impurity、AdaBoost、gradient boosting 與神經網路,程式題是在 madelon 上實作 500 輪 AdaBoost-Stump。期末專題是虛構的 HTMLB 棒球勝負預測,分兩個 Kaggle stage,交一份最多 7 頁的英文報告,至少比較四種方法。沒有官方解答;Kaggle 競賽頁在 2026-09-30 未登入時回 404,校外讀者大概拿不到 HTMLB 資料,只能照同樣的切分方式換一份公開資料自評。

林軒田機器學習基石 L5–L6:假說有無限多個,為什麼還能泛化?——成長函數與 break point

L4 的 Hoeffding 保證裡有一個 M(假說個數),感知器有無限多條線,M 直接爆掉。L5 的解法是不數假說、改數它們在 N 筆資料上能切出幾種 ○× 組合(dichotomy),取最大值就是成長函數 m_H(N)。二維感知器在 4 個點上最多只切得出 14 種,不到 2⁴=16,4 就是它的 break point。L6(官方標 optional)證明:只要有 break point,m_H(N) 就被一個多項式壓住,VC bound 因此成立。

林軒田機器學習基石 L15–L16:驗證與三個學習原則

基石 L15 處理模型選擇:用 E_in 選會過擬合,用 E_test 選是作弊,折衷是從訓練資料切出驗證集,用 E_val 選完再拿全部資料重訓。驗證集大小 K 兩難,經驗值是 K = N/5;LOOCV 幾乎無偏但太貴又不穩,實務上用 5-fold 或 10-fold。L16 用 Occam's razor、sampling bias、data snooping 三個原則收尾,並用「Power of Three」把整門課收成三個領域、三個 bound、三個線性模型、三個工具。練習題在 Fall 2024 HW5。

林軒田機器學習基石 L7–L8:VC 維度怎麼量化模型複雜度,雜訊與誤差衡量又改變了什麼

L7 把「最大的非 break point」命名為 VC 維度 d_VC,證明 d 維感知器的 d_VC = d + 1,再把 VC bound 改寫成「E_out ≤ E_in + 模型複雜度懲罰」:d_VC 太大或太小都不好。理論上要 N ≈ 10,000·d_VC 筆資料,實務上 10·d_VC 常常就夠。L8 把固定的目標函數換成機率分布 P(y|x),說明 VC 理論在有雜訊時仍成立;誤差衡量要依應用而定,例如 CIA 指紋辨識把誤放入侵者罰 1000 倍,可以用「複製樣本」的方式化約成一般分類。

台大李宏毅 機器學習 2026 Spring 導讀:從 AI Agent 切入,評分平台之外幾乎全開

李宏毅 2026 春季的《機器學習》從 OpenClaw 講起,前半學期拆 AI Agent、Context Engineering、推論加速與位置編碼,後半學期講 Harness Engineering、Self-Correction 與 AI 自我成長。8 講投影片、錄影、10 份作業 PDF 與 Colab 全部公開,存取分級是 A3;缺的是評分鏈:JudgeBoi 在 2026-09-30 回傳 502,NTU COOL 限校內,三場演講沒有任何材料。

台大 AI/ML 課程導讀:李宏毅、林軒田、陳縕儂的課,校外到底拿得到哪些?

台大的 AI/ML 課散在電機系與資工系,官方用「機器學習與人工智慧」領域專長把它們排成四層。校外最完整的是李宏毅:ML 2026 Spring 與生成式 AI 與機器學習導論 2025 Fall 都公開投影片、錄影、作業 PDF 與 Colab,只差評分平台。林軒田的錄影齊全,Fall 2024 的 HW0–HW7 題目也留在課程頁;陳縕儂的課錄影齊全,作業大多只公開說明影片;Coursera 自 2025 年 8 月起改為只能免費看第一單元。

CS189 有三個版本:Spring 2026 底本、Spring 2025 經典版、Fall 2026 進行中

Berkeley CS189 在網路上同時有好幾個學期的版本。本系列之後的講次與作業導讀以 Spring 2026(Listgarten/Dimakis)為底本:講義、25 支講課影片、附解答的 discussion、HW1–5 題目與期中考解答都能匿名取得,判為 A3。Spring 2025(Shewchuk)是另一條經典路線,SVM、決策樹、PCA、boosting 只有它講;Fall 2025 的作業資料夾匿名打開是空的,所以不選;Fall 2026 還在進行中,只拿來對照。

CS189 Spring 2026 HW1 導讀:線代/微積分/機率熱身 + Fashion coding

CS189 Spring 2026 HW1 分三塊:10 題書面數學熱身(線性方程組、特徵分解求矩陣冪次極限、SVD、翻轉影像的矩陣、偏微分、遞迴式連鎖律、四題機率含癌症篩檢的 Bayes),加上兩本公開在 Modal 上的 Fashion-MNIST notebook:Part 1 練 pandas/Plotly/K-means/MLP/矩陣做影像增強/tensor 謎題,Part 2 做價格回歸、MAE/MSE/R²、混淆矩陣,最後處理一份被旋轉過的秘密測試集。截止 2/20,沒有官方解答。

CS189 Spring 2026 HW2 導讀:Chatbot Arena 論文題、回歸、MLE/MAP、GMM 到 flow matching

HW2 是一份純書面作業,共 10 題。前半練讀論文(Chatbot Arena)和回歸、MLE/MAP 的基本推導,後半兩大題最重:Mixed Feelings 從 k-means 對離群值的脆弱一路推到 robust k-means 和加了均勻背景的 GMM;Watch Me Flow Dat 證明 conditional flow matching 和離散化後的 MLE 是同一個目標。題目 PDF 和 LaTeX 範本都能匿名下載,沒有官方解答。

CS189 Spring 2026 Lec 1–3:ML 問題框架、資料工具、術語與技巧

CS189 Spring 2026 的前三講不急著推公式,先教你怎麼判斷一個問題該不該用 ML、怎麼用 pandas 和 Plotly 看資料、怎麼用 scikit-learn 走完一次訓練、驗證、測試的流程。Lec 1 只有投影片沒有錄影;Lec 2–3 有投影片與影片;Discussion 1 是微積分、線代、機率的熱身,附解答與 walkthrough。這三講是 HW1 的直接前置。

CS189 Spring 2026 Lec 4–7:K-means、機率複習、MLE、多變量高斯與 GMM

CS189 Spring 2026 第 4–7 講用一條線串起非監督式學習:先用 K-means 分群,指出它的弱點(硬指派、沒有機率框架、只適合體積相近的圓形群),再複習機率、引入最大概似估計(MLE)與多變量高斯,最後把 K-means 改寫成高斯混合模型(GMM)。GMM 的 log-likelihood 沒有封閉解,這個缺口正好把課程帶向梯度下降。四講都有投影片與影片,Discussion 2–3 附解答與 walkthrough。

CS189 Spring 2026 Lec 7–10:線性回歸、最小平方的幾何、正則化

CS189 Spring 2026 用四講把線性回歸講成同一件事的三個角度:高斯雜訊下的 MLE 等於最小平方;最小平方的解是把 y 正交投影到 X 的欄空間;特徵共線或參數太多時,用 ridge(等於高斯先驗的 MAP)或 lasso(等於 Laplace 先驗)把解拉回來,λ 則交給驗證集決定。講義、影片、Discussion 3–4 解答都能匿名取得。

CS189 Spring 2026 Lec 11–12:分類、生成式分類器、logistic regression、ROC

CS189 Spring 2026 Lec 11–12 把分類拆成兩條路:生成式先為每一類建 p(x|y)(GDA:共變異數相同得 LDA、線性邊界,不同得 QDA、二次邊界),判別式直接建 p(y|x)(logistic regression:sigmoid、softmax、交叉熵 MLE,沒有封閉解要靠梯度下降)。兩者的橋是:LDA 的後驗一定能寫成 logistic 形式,反過來不成立。評估方面,準確率在類別不平衡時會騙人,ROC/AUC 掃過所有門檻、不看校準,PR 曲線則在意類別比例。

CS189 Spring 2026 Lec 13、15:收斂、Momentum、Adam、SGD

CS189 Spring 2026 用兩講處理梯度下降。Lec 13 從 Hessian 的特徵值推出學習率上限和條件數,再一路講到 momentum、學習率排程、AdaGrad/RMSProp/Adam 與 mini-batch SGD。Lec 15 由 Dimakis 用一個小資料表手算梯度重走一遍。兩份講義、錄影、Lec 13 的手寫稿,以及 Discussion 6、7(附解答)都能匿名取得。

CS189 Spring 2026 Lec 14、16:MLE vs MAP、bias-variance、熵與 KL,期中自評

Lec 14 把 ridge 重新解釋成「最小平方 + 高斯先驗」的 MAP,再拆解 bias-variance,最後借 Chatbot Arena 示範怎麼讀論文。Lec 16 從壓縮講熵,接到 KL、cross-entropy,再回到 logistic regression 的損失函數。3/17 的期中考題與官方解答都公開在考古題資料夾:6 題、56 分、110 分鐘,另有 6 支逐題講解影片,可以照著模擬一次。

CMU 07-380 Lecture 1 導讀:Introduction,AI & ML II 接在 07-280 之後要解什麼問題

07-380 Lec1 沒有演算法,重點是三件事:「智慧=在不確定性下把任務做好」這條主線、投影片上那張把 07-280 與 07-380 主題分色的 AI/ML 泡泡圖,以及 Quiz 55%、沒有期末考、Project 收尾的評分結構。校外讀者先用這講替後面 25 講定位。

CMU 07-380 Lecture 8 導讀:MAP,先驗怎麼進入估計,為什麼等價於正則化

Lecture 8 把 MLE 的 argmax p(D|θ) 換成 argmax p(θ|D):先驗 p(θ) 乘進 likelihood,取負 log 之後就變成目標函數裡多出來的一項。用 trick coin 看先驗怎麼被資料蓋過,用 Beta 先驗算出點擊率,再把線性迴歸的高斯先驗、Laplace 先驗對到 L2、L1 正則化。

CMU 07-380 Lecture 9 導讀:Probabilistic Generative Models,Naive Bayes 與 Gaussian Discriminant Analysis

Lecture 9 不再直接學 p(y|x),改成先學類別先驗 p(y) 和類別條件分佈 p(x|y),再用 Bayes rule 反推。這樣做要付出更強的假設,換來的是能生成新資料、資料少時比較穩。Naive Bayes 用條件獨立把參數砍到可估計,GDA 用多變量高斯處理連續特徵,共變異數一不一樣決定邊界是直線還是曲線。

Harvard CS181 期末檢核與系列收尾:checklist、practice 與 practical 備援

CS181 2026 期末(5 月 9 日)能公開拿到的 final checklist、second-half practice 16 題與 final review 66 頁都是 2025 版,涵蓋 Bayes net、EM 等 2026 週表沒有的題目,卻缺 Transformer、VAE、GAN、自迴歸模型。先把 checklist 對上 2026 週表分三類,再用 hw 與 section 補新講題,最後拿 2025 practical 補一次端到端專案。

Harvard CS181 HW4(中):Autoencoder 為何不能生成,VAE 補了什麼

HW4 Problem 2 先在 CelebA 64×64 上訓練卷積 autoencoder,再讓你從 N(0, I) 隨機取樣,看它生不出臉;接著推 ELBO、reparameterization 與封閉形式 KL,最後把同一個骨幹改成 VAE,比較兩者的重建與取樣。

Harvard CS181 HW5(上):K-means、HAC 與 PCA,沒有標籤時怎麼整理手寫數字

HW5 的 Problem 3–4 把手寫數字丟給三種不看標籤的方法:K-means 用 10 個平均影像代表整批資料,HAC 用合併樹給出任意群數,PCA 用幾個連續方向壓縮影像。三者都在回答「用少量東西描述資料,誤差多大」,作業要你把它們的目標函數與重建誤差放在一起比。

Harvard CS181 HW5(下):SimCLR 對比學習與 GAN,不靠標籤學表示、不靠似然做生成

HW5 的 Problem 1–2 都是「把學習變成分類題」:SimCLR 的 NT-Xent 損失是在 2N−1 個候選裡找出同一張圖的另一個增強版本,GAN 的判別器是在分真假。作業要你推出這兩件事的數學(交叉熵等價、最佳判別器與 JS divergence),再在 FashionMNIST 與 MNIST 上把兩套訓練迴圈寫出來。

Harvard CS181 HW6(一):自迴歸模型的解碼、KV Cache 與 Speculative Decoding

HW6 Problem 4(20 分)用三個問題拆解「一個 token 接一個 token 生成」的代價:逐步挑最大機率不等於整句最可能、每步重算所有 key 讓成本變成平方級而 KV cache 把它壓回線性、speculative decoding 用小模型先猜再讓大模型一次驗證。全部是紙筆題,但每一題都對應到今天 LLM 推論系統的真實設計。

Harvard CS181 期中檢核:用官方 checklist 盤點 HW0–HW3

CS181 Spring 2026 期中考在 3/10 課堂上進行,佔總成績 15%,閉卷但可帶一張雙面筆記。官方 midterm checklist 分成迴歸、分類、神經網路與模型選擇、SVM 四塊;本篇把每塊對回 HW0–HW3 的題號,標出 2026 作業沒練到的缺口,並說明 2025 版 practice、review 與 concept checks 怎麼用。

AI Engineer 面試日練 — 2026-09-28:ML Fundamentals

今天的 ML Fundamentals 輪練涵蓋五個核心概念:bagging 跟 boosting 分別在打誰的主意(variance vs bias)、boosting 為什麼加太多輪會 overfit 但 random forest 不會、XGBoost 靠梯度加 Hessian 的二階近似跟目標函數內建正則化橫掃表格資料的原因、正規化跟標準化該怎麼選(看演算法假設不是看資料本身),以及 AdamW 為什麼要把 weight decay 從 loss function 的 L2 懲罰項裡拆出來單獨處理。練習題來自 C3 AI 的 Data Scientist 真實面試:先講出經典的 bagging 演算法、解釋 bootstrap aggregation 為什麼能降低 variance,再被追問換成 boosting 又是靠什麼機制取捨,拆解思路把五個概念串成一套完整的 ensemble 決策框架。

AI Engineer 面試日練 — 2026-09-21:ML Fundamentals

今天的 ML Fundamentals 輪練涵蓋五個核心概念:偏差變異取捨怎麼用學習曲線診斷、L1 跟 L2 正則化各自怎麼往 loss function 加懲罰項、批次梯度下降跟隨機梯度下降的取捨、不平衡資料為什麼準確率會騙人(該看 precision/recall/F1/ROC-AUC),以及交叉驗證中最容易忽略的資料洩漏陷阱。練習題改編自 Transunion 的真實 Data Scientist 面試題:如何為大規模資料的端到端 ML 專案設計特徵工程、模型選擇跟驗證策略,拆解思路把五個核心概念串成一套完整的決策框架。

AI Engineer 面試日練 — 2026-09-14:ML Fundamentals

今天的 ML Fundamentals 輪練涵蓋 bias-variance tradeoff、L1(Lasso)/L2(Ridge)/Elastic Net 正則化的差異、overfitting 與 underfitting 的偵測與修復、K-fold/stratified/time-series cross-validation 的選擇,以及 precision、recall、F1、AUC-ROC 在不同業務情境下該優先看哪個。練習題是一道經典的排查題:模型在開發環境表現很好,上線後卻明顯變差,面試官想看你有沒有系統化的除錯框架,而不是憑直覺猜。

AI Engineer 面試日練 — 2026-09-07:ML Fundamentals

這輪 ML Fundamentals 不再是背公式,而是練『模型上線後出包時該怎麼一步步排查』:用學習曲線的 train/val gap 判斷該加特徵還是該正則化、CV 分數跟上線分數不一致時要先懷疑 GroupKFold/TimeSeriesSplit 有沒有做對、類別不平衡的四層排查順序(先重加權而不是先 SMOTE),以及分類門檻該由 FP/FN 的實際成本算出來,不是預設 0.5,還要分清楚門檻選擇跟機率校準是兩件事。

AI Engineer 面試日練 — 2026-08-31:ML Fundamentals

ML fundamentals 面試考的是能不能在拿到一個『指標很漂亮但線上出包』的落差時,講出正確的診斷路徑。今天聚焦四個高頻考點:AUC-ROC 在極度不平衡資料下為什麼會虛高、PR-AUC 才是該看的曲線、分類為什麼要用 cross-entropy 而不是 MSE(牽涉梯度消失)、bagging 和 boosting 分別修正 variance 還是 bias,以及多重共線性只毀可解釋性不毀預測準確度的常見誤解。

Harvard CS50 AI Week 4:Learning——監督式學習、k-NN、SVM、強化學習 Q-learning 與 Nim

Week 4 進入機器學習:監督式分類(k-NN、SVM、Perceptron)、模型評估、強化學習基礎(MDP、Q-learning、ε-greedy),專案 Shopping 預測購買意願、Nim 學會玩遊戲。

A/B testing 怎麼把產品改動變成可推論的效果?

A/B testing 怎麼把產品改動變成可推論的效果? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

多組平均不能一直 t-test:ANOVA 在保護什麼?

ANOVA 先檢查三組以上平均是否有整體差異,避免你用一堆兩兩 t 檢定把 false positive 風險一路放大。

大樣本近似為什麼常能用,又什麼時候不能亂用?

大樣本近似為什麼常能用,又什麼時候不能亂用? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Bayesian inference 怎麼把 prior、資料與 posterior 串起來?

Bayesian inference 怎麼把 prior、資料與 posterior 串起來? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

點估計的 bias、variance、consistency 各在檢查什麼?

bias 看估計中心有沒有歪,variance 看抽樣波動,MSE 合併兩者,consistency 則問樣本變大時估計量會不會靠近真值。

不知道公式分布時,bootstrap 怎麼用重抽樣估不確定性?

不知道公式分布時,bootstrap 怎麼用重抽樣估不確定性? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

因果推論入門:為什麼預測準不代表真的有效?

因果推論入門:為什麼預測準不代表真的有效? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

卡方題怎麼判斷是在考適合度還是獨立性?

卡方檢定處理類別資料的次數差異;先分清楚一個變數對理論比例的適合度,還是兩個類別變數之間的獨立性。

Bernoulli、Binomial、Normal、Poisson 什麼時候該出場?

分布不是公式清單,而是資料生成情境的名字。這篇用 Bernoulli、Binomial、Normal、Poisson 說明如何從題目敘述選分布。

信賴區間怎麼寫,才不是只背上下界公式?

信賴區間把點估計放回抽樣波動裡看;會寫上下界只是第一步,真正要會的是解釋標準誤、臨界值與 coverage。

看到一份資料,第一眼要先看哪些統計量?

資料型態決定你能用什麼統計工具。這篇從類別、數值、計數與時間資料開始,說明平均數、比例、變異數、列聯表在考題和 ML 資料檢查中的用途。

Delta method 怎麼估 F1、ratio 這類非線性指標的不確定性?

Delta method 怎麼估 F1、ratio 這類非線性指標的不確定性? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

好估計量怎麼判斷:不偏、變異、MSE 要看哪個?

估計量是用樣本推母體的計算規則;判斷它好不好,要一起看 bias、variance 與 MSE。

混合題來了,要怎麼在 30 秒內判斷工具?

考前最後階段要練的是題型辨識:先判斷資料型態、未知量與決策目標,再選公式,最後用語境結論收束。

期望值和變異數在考題與模型評估中各代表什麼?

期望值描述長期平均,變異數描述波動大小。這篇用離散分布算例說明 E[X]、E[X^2]、Var(X),並接到平均 loss 和模型穩定度。

實驗設計怎麼讓結果可以被解讀,而不是只像相關?

實驗設計怎麼讓結果可以被解讀,而不是只像相關? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Fisher information 怎麼告訴你參數估得穩不穩?

Fisher information 用 likelihood 的曲率衡量資料對參數的定位能力;資訊越大,MLE 的標準誤通常越小。

信賴區間不只 t 表:一般建構到底怎麼想?

信賴區間不只 t 表:一般建構到底怎麼想? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

GLM 怎麼依資料型態選分布和 link function?

GLM 怎麼依資料型態選分布和 link function? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

假設檢定從 H0 到 p 值,到底要做哪個決策?

假設檢定是一套在不確定資料中做決策的流程:先寫 H0/H1,再用檢定統計量與 p 值判斷資料是否足夠反駁原假設。

估計、檢定、likelihood、Bayes 要怎麼放在同一張推論地圖?

估計、檢定、likelihood、Bayes 要怎麼放在同一張推論地圖? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Likelihood ratio test 怎麼比較兩個巢狀模型?

LRT 比較受限模型和完整模型的 log likelihood 差;只有在 nested model 與近似條件成立時,常見卡方參考分布才有意義。

OLS 的假設壞掉時,迴歸線還能怎麼用?

OLS 的假設壞掉時,迴歸線還能怎麼用? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

分類模型為什麼要先學 log odds?

logistic regression 把線性分數接到 0 到 1 的機率;讀懂 odds、log odds、odds ratio,才不會把分類模型係數解釋錯。

Logistic regression 怎麼從機率走到 threshold 和錯誤成本?

Logistic regression 怎麼從機率走到 threshold 和錯誤成本? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

MAP 為什麼會把先驗變成 regularization?

MAP 為什麼會把先驗變成 regularization? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Matching 和 weighting 怎麼讓觀察資料比較像實驗?

Matching 和 weighting 怎麼讓觀察資料比較像實驗? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

MLE 為什麼是在問:哪個參數最可能生成這批資料?

MLE 把資料固定、比較不同參數讓這批資料出現的合理程度;log likelihood 讓乘積變加總,也接上 ML 的 negative log loss。

Method of Moments 為什麼是用樣本矩對母體矩?

Method of Moments 用樣本矩對上理論母體矩,再解出參數;它不一定最有效率,但很適合建立參數估計的第一個直覺。

缺資料不只是空格:它會怎麼扭曲統計和模型?

缺資料不只是空格:它會怎麼扭曲統計和模型? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

ML/AI 評估報告怎麼寫,才不只是貼排行榜分數?

ML/AI 評估報告怎麼寫,才不只是貼排行榜分數? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

殘差、outlier、leverage 在告訴你模型哪裡壞了?

殘差、outlier、leverage 在告訴你模型哪裡壞了? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

多變量分析怎麼整理一起變動的特徵?

多變量分析怎麼整理一起變動的特徵? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Neyman-Pearson 觀點在說哪一種最佳檢定?

Neyman-Pearson 把檢定看成決策規則:在固定第一型錯誤 alpha 下,選出 power 最高的拒絕區域。

Nonparametric methods 少做哪些分布假設?彈性又要付出什麼代價?

Nonparametric methods 少做哪些分布假設?彈性又要付出什麼代價? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

台大資管 114–115 統計考古題要怎麼拆,不要只背答案?

考古題的價值是訓練拆題紀律,不是用兩年題型猜完整範圍;每題都要回到資料型態、未知量、工具、計算與語境結論。

聯合分布和 PMF 轉換題,怎麼不漏格?

聯合 PMF 題要把所有格子列完;邊際化、條件機率和變數轉換,本質上都是對原始格子的加總與重新分組。

條件機率、獨立、貝氏:考題到底在換哪個視角?

機率題的難點常在視角,不在公式。這篇用事件、條件機率、獨立與 Bayes rule,說明考題如何從原因到結果、再從結果反推原因。

樣本、統計量、抽樣分布三者怎麼分清楚?

樣本是資料,統計量是樣本的函數,抽樣分布是統計量在重複抽樣下的分布;這三者分清楚,推論公式才會有意義。

PMF、PDF、CDF 怎麼把機率變成可計算的題目?

隨機變數把事件結果轉成數字。這篇用 PMF、PDF、CDF 說明離散與連續機率怎麼計算,並接到模型分數、threshold 和 token 機率分布。

迴歸表的 coef、SE、t、F、R2 要怎麼一起讀?

迴歸表不是 p 值清單;coef、SE、t、F、R2 分別回答效果大小、不確定性、單一係數、整體模型與樣本內解釋力。

Ridge、Lasso、weight decay 為什麼能讓模型穩一點?

Ridge、Lasso、weight decay 為什麼能讓模型穩一點? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

統計與 ML 評估怎麼做才重跑得出同一個結論?

統計與 ML 評估怎麼做才重跑得出同一個結論? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

為什麼只看樣本,也能推回母體或模型表現?

抽樣讓樣本統計量有波動,標準誤描述這個波動。這篇分清楚 SD、SE、抽樣分布與 CLT,並接到 benchmark 分數的不確定性。

抽樣分配怎麼從公式變成考試可用的判斷?

抽樣分配描述統計量在重複抽樣下的波動;平均、比例、變異數各有常用分布,信賴區間和檢定都從這裡長出來。

讀完 53 篇後,怎麼把統計接到 ML、因果與數理統計?

讀完 53 篇後,怎麼把統計接到 ML、因果與數理統計? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

一條迴歸線怎麼變成預測、解釋與誤差?

簡單線性迴歸用一個 X 描述 Y 的平均變化;斜率、截距、殘差和平方誤差共同構成最小的 supervised learning 模型。

Monte Carlo 怎麼用重複模擬回答算不動的統計問題?

Monte Carlo 怎麼用重複模擬回答算不動的統計問題? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

統計學從哪裡開始讀,才接得上考試和 ML/AI?

準備統計學不要從背公式開始。這篇先建立讀書順序:資料、機率、抽樣、推論、迴歸,再接到模型評估、A/B testing 與 ML/AI 的不確定性判斷。

時間序列為什麼不能隨機切資料?

時間序列為什麼不能隨機切資料? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

兩組平均或比例差異,該用哪一種比較題型?

兩組比較要先判斷 outcome 是數值還是比例、兩組資料是否獨立;這一步會決定標準誤、檢定統計量與結論可信度。

變數選擇怎麼避免把訓練資料背起來?

變數選擇怎麼避免把訓練資料背起來? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

統計學不是背公式:它到底在替你判斷什麼?

統計學的核心不是公式,而是判斷:描述資料、估計未知量、比較差異、檢查關聯,最後在不確定性下做決策。

techdeep-dive

GPUtw.ai 是什麼:台灣在地 GPU 雲端、短租算力與研究者工作流

GPUtw.ai 是台灣在地的短租 GPU 雲端,核心不是最大規模的算力,而是台灣機房、預付點數、Jupyter/ComfyUI/Ollama/vLLM 範本、Vault 與團隊帳務。公開資料足夠做服務介紹,還不足以當正式採購或 production 背書。

Harvard CS181 HW0:開學前先做這 4 題,卡哪題就先補哪裡

HW0 用四題檢查 CS181 的先修:矩陣 y=Xw 的可解條件、目標函數的微分與優化、機率推理,以及用 Python 實作 OLS。做不順的地方就是開學後要優先補的缺口。

Harvard CS181 HW1:冰芯溫度迴歸 — kNN、核迴歸、基底函數與正則化四題導讀

HW1 用 80 萬年冰芯溫度資料串起四題:kNN 與核迴歸、最小平方法的幾何證明、基底函數迴歸、以及從機率觀點推出 ridge/LASSO 正則化,最後用 coordinate descent 實作 LASSO。

Harvard CS181 Machine Learning 導讀總覽:2026 七份作業怎麼跟?四年版本一次看懂

CS181 2026 以 hw0–6 七份作業為週節拍、無當期錄影但 A3 可自學;2025 多 practical、2024 雙期中、2023 單授 Weiwei Pan。看懂四年沿革後,從 HW0 體檢先修再逐週跟最穩。

Ahead of AI:一位學者用月更深度文做到 20 萬訂閱的反直覺路線

計算生物學博士、前威斯康辛大學統計系教授 Sebastian Raschka,2022 年在 Substack 創辦 Ahead of AI,用月更長文拆解 LLM 論文與架構,四年做到 20 萬+訂閱。他刻意不接贊助、不追日更,靠書籍和付費訂閱變現,證明低頻高深度在 AI 電子報紅海裡也能走出一條路。

2021 AI 頂會導讀:機器學習篇

2021 年是 diffusion model 超越 GAN、自監督學習理論突破、RL 評估方法論覺醒的一年。NeurIPS 收了 9,122 篇投稿創當時紀錄,ICLR 的 Score-Based Generative Modeling 論文日後成為整個 diffusion 生態的理論基石,ICML 則在優化理論與自監督學習動力學分析上交出紮實貢獻。

2022 AI 頂會導讀:機器學習篇

2022 年是 diffusion model 登上頂會舞台中央、Chinchilla scaling laws 改寫大模型訓練範式、Chain-of-Thought 讓推理成為可提示能力的一年。NeurIPS 破萬篇投稿,13 篇 Outstanding Paper 裡有 3 篇跟 diffusion 直接相關,Chinchilla 和 data pruning 兩篇挑戰了『大就是好』的信條。ChatGPT 年底發佈前夜,所有拼圖都在這一年的頂會上各就各位。

2023 AI 頂會導讀:機器學習篇

2023 年是 LLM 全面接管 ML 頂會的一年。NeurIPS 投稿破 12,000 篇,兩篇 Outstanding Paper 都直接針對大模型(隱私審計與湧現能力質疑),Runner-Up 的 DPO 在短短兩年內成為 RLHF 的實質替代標準。ICLR 的 DreamFusion 開啟了 text-to-3D 賽道,ICML 則把 LLM 水印和學習率自適應推上舞台。Mamba 以 arXiv 預印本之姿在 NeurIPS 現場引爆討論,預示 Transformer 的第一個真正挑戰者即將到來。

2024 AI 頂會導讀:機器學習篇

2024 年是 ML 頂會投稿量爆炸的一年:NeurIPS 收到 15,671 篇創歷史紀錄,ICML 和 ICLR 也分別突破九千和七千。研究主題從「把模型練更大」轉向「推論時怎麼花算力更聰明」——test-time compute scaling 成為年度最重要的新方向。Best Paper 層面,VAR 用 next-scale prediction 在影像生成上超越 diffusion、Rectified Flow 成為 Stable Diffusion 3 的理論基礎、ICLR 首次頒發 Test of Time Award 給 VAE 原論文。

2025 AI 頂會導讀:機器學習篇

2025 年是 ML 頂會投稿量全面破紀錄、審稿系統承壓到極限的一年。NeurIPS 收了 21,575 篇投稿動用超過兩萬名審稿人,ICML 首度突破 12,000 篇,ICLR 也衝上 11,565 篇。研究主題上,reasoning 與 agent 成為最強勢的兩股潮流——NeurIPS Best Paper 之一直接質疑 RLVR 是否真的帶來新推理能力,拿下該屆唯一滿分;而 attention 機制的結構性改進(Alibaba Qwen 的 Gated Attention)和 neural scaling laws 的理論解釋同時獲獎,標誌著社群正從「衝規模」轉向「理解為什麼有效」。

AI Engineer 面試日練 — 2026-08-24:ML Fundamentals

ML fundamentals 面試考的不是背定義,而是拿到一個 train/val 落差時能不能走出一套診斷流程。今天聚焦四個高頻考點:bias-variance decomposition 與 learning curve 判讀、L1/L2 正則化的幾何直覺與選擇邏輯、loss function 要對齊商業目標而非預設值,以及 AdamW 為什麼把 weight decay 和 L2 正則化拆開處理。

CMU 07-280 全課總結:學會什麼、缺什麼,以及下一門怎麼選

完成 07-280 不等於看完 24 篇導讀;至少要留下搜尋器、監督式模型、CNN/GPT-2 實驗與一個 RL+MCTS 小系統,再依缺口選 07-380、10-301 或專題課。

CMU 07-280 完整課程導讀:搜尋、GPT-2、AlphaZero 為什麼在同一門課?

07-280 是 CMU Spring 2026 首開的 AI+ML 核心:24 講、12 個作業編號,從 heuristic search、CSP 與機器學習一路做到 AlexNet、GPT-2、AlphaZero。教材足以自學,但沒有完整公開錄影、Canvas checkpoint 或 Gradescope 回饋。

CMU 07-280 Lecture 1 導讀:AI、機器學習與表示學習的共同問題

Lecture 1 用 alien autoencoder、AI/ML 範圍與 AI 發展史建立全課座標:智慧系統不是模型清單,而是在不確定下把輸入表示成可計算決策。

CMU 07-280 Lecture 5 導讀:用 Loss、Risk 與 ERM 定義機器學習

Lecture 5 把機器學習寫成 `X → Y`、loss、risk 與 empirical risk minimization:訓練集只能提供平均已知損失,真正目標仍是未知分布上的 generalization。

CMU 07-280 Lecture 6 導讀:Decision Trees 如何用 Mutual Information 分裂資料

Lecture 6 從 decision stump 遞迴建樹,用 entropy 衡量 label uncertainty,再以 `I(Y;W)=H(Y)-H(Y|W)`選擇分裂;這是計算可行的 greedy ERM,不是全域最佳樹保證。

CMU 07-280 Lecture 7 導讀:Linear Regression 與 Normal Equation

Lecture 7 把 ERM 套到 linear functions 與 squared loss,從一維 slope 推到矩陣形式 `argmin ||y-Xθ||²`,再在 `XᵀX` 可逆時得到 normal equation。

CMU 07-280 Lecture 8 導讀:Gradient Descent、SGD 與 Learning Rate

Lecture 8 從一維 parabola 推到 vector gradient,再比較 batch GD、SGD 與 mini-batch;learning rate 決定更新是收斂、震盪或發散。

CMU 07-280 Lecture 9:Logistic Regression 如何把分類改寫成機率估計

Lecture 9 不直接預測 0 或 1,而以 sigmoid 建模 P(y=1|x),再用 cross-entropy 與凸最佳化學出參數;多類別版本自然延伸成 softmax regression。

CMU 07-280 Lecture 10:Feature Engineering 與 Regularization 如何交換表達力和穩定性

Lecture 10 先用 φ(x) 讓線性模型表達非線性,再以 train/validation/test 分工、L1/L2 regularization 與 model selection 限制新增自由度造成的過度擬合。

CMU 07-280 Lecture 11:從 Logistic Regression 組出第一個 Neural Network

Lecture 11 把單一 logistic neuron 擴成多層網路:linear layer 產生 z、activation 產生 a,多個 neuron 共同學出 feature transform,再以 loss 和 gradient descent 訓練權重。

CMU 07-280 Lecture 12:Backpropagation 如何重用 Chain Rule

Lecture 12 把神經網路視為 computation graph:forward pass 保存中間量,backward pass 從 loss 開始傳遞 upstream gradient,並用線性層、activation 與 softmax 的局部規則一次算出全部參數梯度。

CMU 07-280 Lecture 16:Maximum Likelihood 如何統一 Logistic 與 Linear Regression

Lecture 16 從 likelihood p(D|θ) 出發,以 i.i.d. 將聯合機率寫成乘積,再用 log 變成和;Bernoulli MLE 得到樣本比例,conditional Bernoulli 得到 logistic cross-entropy,Gaussian noise 則得到 squared error。

CMU 07-280 階段複習一:從搜尋問題走到監督式學習

第一階段把 Lectures 1–12 串成同一條決策鏈:先定義狀態、動作與目標,再用 heuristic、loss、regularization 與 backpropagation 控制龐大搜尋空間。

aideep-dive

DSPy:用 Signature、Metric 與 Optimizer 編譯 AI 程式

DSPy 不把 prompt 當手寫字串,而以 Signature 宣告任務、Module 決定執行策略,再用資料集與 metric 讓 Optimizer 編譯出較好的提示與示例。

aideep-dive

Hugging Face 不只是模型下載站:Hub、Datasets、Spaces 與 Inference 怎麼分

Hugging Face Hub 是以版本化 repository 串起模型、資料集與應用程式的協作層;Datasets 管資料,Spaces 跑展示程式,Inference Providers 與 Endpoints 才負責代管推論。

線性迴歸:從 LMS 到局部加權迴歸

線性迴歸不只是一條最佳直線;第一章用平方損失串起梯度下降、常態方程、最大概似估計與局部加權迴歸。

分類與邏輯斯迴歸:從決策邊界到 Newton 法

第二章從 sigmoid 機率模型推導邏輯斯損失,再比較感知器、多類別 softmax 與 Newton 法。

廣義線性模型:用指數族統一迴歸與分類

第三章用指數族、自然參數與連結函數,把最小平方法和邏輯斯迴歸放進同一套建模模板。

生成式學習演算法:GDA、Naive Bayes 與平滑

第四章改從 p(x|y) 與 p(y) 建模,用 GDA、Naive Bayes 和 Laplace 平滑展示生成式分類的力量與代價。

核方法:不顯式展開特徵的非線性學習

第五章把高維特徵的內積改寫成 kernel,讓依賴內積的線性演算法在不顯式建立特徵的情況下學非線性。

支援向量機:間隔、對偶與 SMO

第六章把分類信心形式化為幾何間隔,再用拉格朗日對偶、kernel 與 SMO 建出可實作的 SVM。

深度學習:模組、反向傳播與向量化

第七章把神經網路拆成可組合模組,並用反向傳播與向量化說明深度模型如何有效率地訓練。

泛化:偏差變異、雙降與樣本複雜度

第 8 章把測試誤差拆成不可避免雜訊、偏差平方與變異,再用 uniform convergence 與 VC dimension 說明模型何時能從訓練資料泛化;雙降則提醒我們,參數數量不是萬用的複雜度尺度。

正規化與模型選擇:顯式、隱式與交叉驗證

第 9 章把泛化控制拆成三條路:在損失中顯式懲罰複雜度、利用最佳化器偏好的隱式正規化,以及用未參與訓練的資料選模型;MAP 則說明高斯先驗如何對應 L2 懲罰。

分群與 k-means:交替最佳化的第一個範例

第 10 章用 k-means 建立非監督式學習的第一個完整演算法:交替更新會讓 distortion 單調不增並在數值上收斂,但不保證得到全域最佳解。

EM 演算法:從高斯混合到 VAE

第 11 章從高斯混合模型的軟指派出發,用 Jensen inequality 建立 ELBO,將 EM 解釋為對變分分布與模型參數的交替最大化,再以近似後驗與 reparameterization trick 延伸到 VAE。

主成分分析:投影、重建與降維

第 12 章把 PCA 寫成一個幾何最佳化問題:在單位方向上最大化投影變異,解就是共變異矩陣的主特徵向量;取前 k 個特徵向量,同時得到保留最大變異與最小線性重建誤差的低維表示。

獨立成分分析:從混合訊號恢復獨立來源

第 13 章把 ICA 建模為 x=As:觀測是未知線性混合,目標是估計 W=A^{-1} 恢復獨立且非高斯的來源。變數變換的 Jacobian determinant 進入 likelihood,導出 Bell–Sejnowski 的梯度更新。

擴散模型:正向加噪、反向生成與 ELBO

第 14 章從固定的高斯加噪 Markov chain 出發,學習逐步反轉每個 transition;ELBO 把 reverse-kernel matching 化成加權雜訊預測,連續時間觀點則用 score ∇log p_t 解釋反向漂移。

CS188 決策與機器學習:從 VPI、Naive Bayes 到 Attention

Lecture 19–25 把 rational decisions、VPI 與 ML 接起來,Project 5 再用 PyTorch 實作 regression、分類、CNN、attention 與 optional character-GPT。

Berkeley CS189 Spring 2025 總覽:用 HW1–7 與 code/data 走完的機器學習,用 Fall 2026 看下一學期

CS189 在網路上有好幾個學期的版本。本系列從第 2 篇起以 Spring 2026(eecs189.org/sp26,A3)為底本,逐講、逐份作業導讀;Spring 2025(Shewchuk)是另一條經典路線,公開 25 講 notes、HW1–7 與歷屆考題,但正式錄影在 bCourses 要登入;Fall 2026 還在進行中,只拿來對照。本篇是系列入口與全系列目錄。

CMU 07-380 Fall 2026 總覽:首開 26 講從邏輯與規劃到擴散模型,HW 與 Project 尚未全開放

07-380 Fall 2026 是 CMU AI 新制第二門首開,26 講涵蓋邏輯、規劃、優化、機率圖、生成式與系統。依 2026-09-29 課站,Lec1–9 投影片、PR1–6 筆記、Rec1–5(含解答)與 HW1–3 已公開,本站已寫完對應的 14 篇逐講導讀;Lec10 之後的投影片、HW4–7 與 Final Project 還沒釋出,整門課仍是 A2。

CMU 10-301 HW1:先用數學與 Python 找出機器學習地基缺口

HW1 是 written+programming 作業:用機率、微積分、線代與 CS 題組檢查地基,再實作 majority-vote classifier。

CMU 10-301 HW2:從資訊量手算到完整 Decision Tree

HW2 要先用 entropy 與 mutual information 手算切分,再完成建樹、預測與評估的端到端分類器。

CMU 10-301 HW3:比較 K-NN、Perceptron 與 Linear Regression

HW3 是純 written 作業,以 decision tree 回顧,再比較 K-NN、Perceptron 與 Linear Regression 的 inductive bias、誤差與 model selection。

CMU 10-301 HW4:把 Logistic Regression 從 likelihood 寫成分類器

HW4 把機率解釋、cross-entropy 梯度與程式實作綁在一起,驗收的是一條可追蹤的訓練流程。

CMU 10-301 HW5:用 NumPy 拆開 Neural Network 與 Backpropagation

HW5 的價值在於不靠自動微分,親手追蹤 forward shapes、cache 與 backward gradients。

CMU 10-301 HW6:Learning Theory、MLE/MAP 與公平指標

HW6 把 generalization、MLE/MAP、probabilistic learning、公平指標與社會影響放在同一份 written 作業,逼你說清楚假設與取捨。

CMU 10-301 HW7:從基礎神經網路走到 Deep Learning

HW7 在 HW5 的 backpropagation 地基上加入深度模型的架構與訓練問題,重點是診斷而非只把網路加深。

CMU 10-301 HW8:從 MDP 到 Reinforcement Learning 更新規則

HW8 把 state、action、reward、transition 與 value update 接起來,驗收你能否區分環境動態、policy 與估計誤差。

CMU 10-301 HW9:用 Ensembles、k-Means、PCA 與推薦系統收束全課

最後一份 written 作業把 ensemble、clustering、representation 與 recommendation 並列,驗收你能否按問題結構選學習典範。

CMU 10-301/601 Spring 2026:用九份作業學完整機器學習

Spring 2026 的 10-301/601 公開 27 講教材與九份作業包;校外讀者能完成主要實作,但拿不到 Panopto、Piazza、Gradescope 與正式作業解答。

learningdeep-dive

CMU AI 核心改制:15-281+10-315 到 07-280+07-380,不只是換課號

CMU 在 2026 年把原本分開的廣義 AI 與 SCS 機器學習入口,重新整合成 07-280 → 07-380;這是內容與先修路線的重切,不是兩門課逐一改名。

Harvard AI/ML 課程導讀:CS50 AI、CS181、CS182 的影片與作業是不是同一版?

Harvard 校外最完整的入口是 CS50 AI,但 Summer 2026 實際沿用 2020 錄影與作業資產,OCW 作業又已更新到不同版本;CS181 Spring 2026 公開當期作業與講義、沒有當期錄影,CS182 Fall 2026 則尚未完成開課。

Stanford CS109 Lecture 20|Logistic Regression:從 Bernoulli likelihood 推出 gradient

Logistic regression 用 sigmoid 把線性分數變成 Bernoulli 機率,而 gradient xⱼ(y-ŷ) 直接來自 log-likelihood 的 chain rule。

Stanford CS109 Lecture 21|Comparing Classifiers:accuracy 之外還要問 calibration、錯誤成本與 fairness

比較 classifier 不能只看 accuracy;還要用 held-out data、baseline、calibration、precision/recall 與明確的 fairness criterion。

Lambda Cloud:從單台 GPU VM 到多節點 AI Cluster 的算力雲

Lambda Cloud 提供 on-demand GPU VM 與 1-Click Cluster;它賣的是較直接的 AI 算力環境,不是自動完成 training、serving 與 MLOps。

Replicate:把模型版本變成 Prediction API,而不是租一台 GPU

Replicate 以 versioned model、prediction、Cog 與 deployment 抽象 GPU;整合者要負責版本釘選、async workflow、webhook 驗證、資料保存與成本上限。

RunPod:GPU Pod 與 Serverless Endpoint 是兩種不同產品

RunPod Pod 適合互動與長駐 GPU 工作,Serverless 適合 queue-based 或 load-balanced inference;選錯會把 persistence、cold start 與重試語意混在一起。

Stanford CS229 導讀:講義每年重編,公開作業停在 2020,官方自測題是 2008 年的

CS229 的自學三件套不在同一個時鐘上:講義 278 頁、2026 年 8 月才重編過;公開拿得到的作業是 2020 年夏季那批;Stanford Online 叫你入學前先做的自測題,PDF 建立於 2008 年。2026 春季錄影公開 17 支,最後三支的標題跟內容對不上。

Berkeley AI/ML 課程導讀:從 CS61A 到 CS288,最新公開教材怎麼排

Berkeley 沒有獨立的大學部 AI 學位;可行路線是在 CS BA 或 EECS BS 的共同基礎上,從 CS188 的廣義 AI 或 CS189 的數學型 ML 入口,再分流到深度學習、NLP、視覺與強化學習。2025–2026 有不少 A3 公開課,但最新班次、最新穩定網址與最好用的自學版本並不總是同一個。

CMU AI/ML 課程導讀:07-280 新主幹與校外可走的公開路線

CMU 現行 BSAI 已改成 07-280 → 07-380,再從 NLP/視覺核心與四個 AI clusters 延伸;07-380 已在 Fall 2026 首開,同學期還新開了研究所級的 11-768 AI Agents。07-280 Spring 2026 的殘留教材與 10-301/601 已能完整自學,15-281 則是仍有價值的退休舊路線。

MIT AI/ML 課程導讀:6-4 是正式 AI 學位,公開教材卻分散在三個年代

MIT 自 2022 年已有正式的 6-4 Artificial Intelligence and Decision Making 學位;但校外自學時,現行學位要求、2025–2026 課站與最好用的 OCW 版本往往不是同一套。真正可行的路線,是先照 6-4 的程式、演算法、線代與機率骨架打底,再依公開程度選 6.S191、6.3900、6.4110、6.7960、電腦視覺或機器人分支。

Stanford CS109 導讀:一門機率課把「怎麼用語言模型讀這一講」寫成了官方教材

CS109 在 2026 年夏季的每一講旁邊,掛了一份官方寫的 LLM Learning Guide——六個概念、每個概念一組 Learn 與 Test me 提示詞,逐週產出共 23 份 PDF。同一門課的榮譽守則第 4 條卻明文禁止拿 LLM 解作業,而成績有 65% 壓在現場考試。這兩件事是同一套設計的兩半。

Stanford CS161 Lecture 18:從演算法工具箱走向 LP、編碼與 ML

期末課以 slides 回顧 CS161 工具箱,再用 LP duality、Reed–Solomon 與 ML-assisted algorithms 指向後續方向;官方沒有提供 notes。

ML Fundamentals 面試攻略:從 bias-variance 到 evaluation metrics

ML 基礎面試不考你背公式,考你能不能用直覺解釋概念、在追問下不崩潰。高頻考點:bias-variance tradeoff 的實際意義、L1/L2 regularization 的選擇邏輯、cross-entropy 為什麼比 MSE 適合分類、SGD 與 Adam 的取捨、precision/recall 在不同場景的重要性差異。

AI Engineer 面試全景圖:從公司類型到準備策略

AI Engineer 面試不只考 ML——大廠看系統設計與 coding,新創看端到端交付,AI-native 公司看 LLM 工程深度。準備策略:先釐清目標公司類型,再按六大維度(ML 基礎、系統設計、LLM 應用、Coding、Paper Reading、行為面試)分配時間。

aiguideAI 證照備考

Google PMLE 備考路徑:考綱重寫後怎麼準備

Google Professional ML Engineer 的考綱在 2026 年被重寫,Vertex AI 全面改名為 Gemini Enterprise Agent Platform,舊教材的產品名對不上題目。這篇以官方 exam guide 的六章權重為骨架,逐章列出考什麼、配哪些官方材料、練什麼,並換算成一份看得懂依據的時程。官方規格:$200、兩小時、50–60 題單選加複選、效期兩年、建議 3 年以上業界經驗含 1 年以上 Google Cloud。

AI Project Strategy:三四個小時的試算表,省掉幾週的錯方向

Andrew Ng 用 deep researcher 當例子示範 error analysis:列是 pipeline 的每個步驟,行是 10 到 100 個查詢,只看表現不好的那些,逐格標記哪裡壞掉。百分比不需要加起來等於 100%。他說這要花三四個小時,但省下的是幾週走錯方向的時間——而真的會去做的人的比例遠低於 100%。

Full Cycle of a DL Project:資料收兩天就好

Andrew Ng 用人臉辨識開門系統走完整個專案生命週期,而全講只有一個核心論點:速度。他給團隊的期限是兩天,理由是「花在準備資料的時間,應該和訓練一次模型的時間相稱」。最後收在一句話:我的工作是做出一個真的能用的東西,那和做出一個在測試集上能用的東西不一樣。

飛控的「自主」共 56 項,只有一項是為了把握機會

ArduPilot 的 ModeReason 列舉就是「機上自主決策」的完整清單:56 個值裡 43 個是飛機自己決定的,其中 21 個是偵測到危險,而只有 SOARING_THERMAL_DETECTED 一項是因為發現機會。至於 end-to-end,PX4 主線那個 mc_nn_control 的 tensor arena 只有 10 KB、Kconfig 預設 n,ArduPilot 主線一個都沒有。