這是 CS229 Lecture Notes 2026 版第 12 章(印刷頁 167–172)的逐章導讀,依官方主講義整理,不是某一學期錄影內容的重建。本篇沿著「找出資料近似所在的線性子空間」這條主脊,串起前處理、最大變異、特徵向量與降維。
PCA 處理的是資料座標之間的線性冗餘。例如同一車速同時用 mph 與 km/h 記錄,兩欄幾乎是同一資訊;若資料大致沿某個斜方向散布,真正重要的變化可能只需要一個內在軸。
前處理先決定什麼叫「大變化」
講義通常先對每個特徵減去平均,再除以經驗標準差:
$$ x_j^{(i)}\leftarrow\frac{x_j^{(i)}-\mu_j}{\sigma_j}. $$
中心化讓原點成為資料平均,後續 $\frac1n\sum_ix^{(i)}x^{(i)T}$ 才是共變異矩陣。除以標準差則讓不同單位可比較;若一欄是車速、另一欄是座位數,不縮放會使數值較大的欄位主導方向。
但尺度化不是機械規則。若所有像素本來就在相同量尺,或實際振幅本身具有意義,任意標準化也可能扭曲問題。PCA 的答案永遠相對於你選擇的座標與尺度。
最大投影變異導出主特徵向量
取單位向量 $u$,資料 $x^{(i)}$ 在該方向的座標是 $u^Tx^{(i)}$。要保留最多變化,就最大化平均平方投影:
$$ \max_{|u|2=1}\frac1n\sum_i(u^Tx^{(i)})^2 =\max{|u|_2=1}u^T\Sigma u, \qquad \Sigma=\frac1n\sum_ix^{(i)}x^{(i)T}. $$
這是 Rayleigh quotient;解為 $\Sigma$ 最大特徵值對應的特徵向量。直覺上,$u$ 不是「最靠近所有點的線」的神祕猜測,而是在單位長度限制下接住最多投影能量的方向。
若要降到 $k$ 維,取前 $k$ 個互相正交的特徵向量 $u_1,\ldots,u_k$,並以
$$ y^{(i)}=[u_1^Tx^{(i)},\ldots,u_k^Tx^{(i)}]^T $$
表示原資料。這組基底保留最大的總投影變異,也等價於在所有 $k$ 維線性子空間中最小化平方重建誤差。
它能做什麼,又丟掉什麼
PCA 可用於壓縮、二或三維視覺化、在監督式學習前降低輸入維度,以及把低變異方向當作雜訊丟棄。講義以 eigenfaces 說明:把人臉影像投到較低維空間後,用低維距離做比對,期望保留系統性外觀差異並減少光線等細小擾動。
限制也來自同一設計。PCA 只看線性子空間與二階變異,無法展開彎曲流形;高變異不一定代表任務相關資訊,低變異也不一定是雜訊;離群值會強烈影響平均與共變異矩陣。若 PCA 放在預測 pipeline 裡,中心、尺度與主成分都必須只在訓練資料估計,否則會把驗證或測試資訊洩漏進模型。
與前後章的關係
第 11 章用機率隱變數建模資料;PCA 改以確定性的正交投影找低維表示。下一章 ICA 同樣換基底,目標卻不是最大變異或正交,而是讓恢復出的來源彼此獨立。兩者不能只因為都在做線性變換就混為一談。
自學練習
取一份含兩個量尺差很多特徵的二維資料。分別對「只中心化」與「中心化加標準化」計算共變異矩陣、主特徵向量及第一主成分解釋的變異比例。畫出兩條主軸,說明尺度選擇如何改變 PCA 認為最重要的方向。
參考資料
Loading...