Skip to content

主成分分析:投影、重建與降維

2026年8月22日 1 分鐘
TL;DR 第 12 章把 PCA 寫成一個幾何最佳化問題:在單位方向上最大化投影變異,解就是共變異矩陣的主特徵向量;取前 k 個特徵向量,同時得到保留最大變異與最小線性重建誤差的低維表示。
目錄
  1. 前處理先決定什麼叫「大變化」
  2. 最大投影變異導出主特徵向量
  3. 它能做什麼,又丟掉什麼
  4. 與前後章的關係
  5. 自學練習
  6. 參考資料

🌏 English version

這是 CS229 Lecture Notes 2026 版第 12 章(印刷頁 167–172)的逐章導讀,依官方主講義整理,不是某一學期錄影內容的重建。本篇沿著「找出資料近似所在的線性子空間」這條主脊,串起前處理、最大變異、特徵向量與降維。

PCA 處理的是資料座標之間的線性冗餘。例如同一車速同時用 mph 與 km/h 記錄,兩欄幾乎是同一資訊;若資料大致沿某個斜方向散布,真正重要的變化可能只需要一個內在軸。

前處理先決定什麼叫「大變化」

講義通常先對每個特徵減去平均,再除以經驗標準差:

$$ x_j^{(i)}\leftarrow\frac{x_j^{(i)}-\mu_j}{\sigma_j}. $$

中心化讓原點成為資料平均,後續 $\frac1n\sum_ix^{(i)}x^{(i)T}$ 才是共變異矩陣。除以標準差則讓不同單位可比較;若一欄是車速、另一欄是座位數,不縮放會使數值較大的欄位主導方向。

但尺度化不是機械規則。若所有像素本來就在相同量尺,或實際振幅本身具有意義,任意標準化也可能扭曲問題。PCA 的答案永遠相對於你選擇的座標與尺度。

最大投影變異導出主特徵向量

取單位向量 $u$,資料 $x^{(i)}$ 在該方向的座標是 $u^Tx^{(i)}$。要保留最多變化,就最大化平均平方投影:

$$ \max_{|u|2=1}\frac1n\sum_i(u^Tx^{(i)})^2 =\max{|u|_2=1}u^T\Sigma u, \qquad \Sigma=\frac1n\sum_ix^{(i)}x^{(i)T}. $$

這是 Rayleigh quotient;解為 $\Sigma$ 最大特徵值對應的特徵向量。直覺上,$u$ 不是「最靠近所有點的線」的神祕猜測,而是在單位長度限制下接住最多投影能量的方向。

若要降到 $k$ 維,取前 $k$ 個互相正交的特徵向量 $u_1,\ldots,u_k$,並以

$$ y^{(i)}=[u_1^Tx^{(i)},\ldots,u_k^Tx^{(i)}]^T $$

表示原資料。這組基底保留最大的總投影變異,也等價於在所有 $k$ 維線性子空間中最小化平方重建誤差。

它能做什麼,又丟掉什麼

PCA 可用於壓縮、二或三維視覺化、在監督式學習前降低輸入維度,以及把低變異方向當作雜訊丟棄。講義以 eigenfaces 說明:把人臉影像投到較低維空間後,用低維距離做比對,期望保留系統性外觀差異並減少光線等細小擾動。

限制也來自同一設計。PCA 只看線性子空間與二階變異,無法展開彎曲流形;高變異不一定代表任務相關資訊,低變異也不一定是雜訊;離群值會強烈影響平均與共變異矩陣。若 PCA 放在預測 pipeline 裡,中心、尺度與主成分都必須只在訓練資料估計,否則會把驗證或測試資訊洩漏進模型。

與前後章的關係

第 11 章用機率隱變數建模資料;PCA 改以確定性的正交投影找低維表示。下一章 ICA 同樣換基底,目標卻不是最大變異或正交,而是讓恢復出的來源彼此獨立。兩者不能只因為都在做線性變換就混為一談。

自學練習

取一份含兩個量尺差很多特徵的二維資料。分別對「只中心化」與「中心化加標準化」計算共變異矩陣、主特徵向量及第一主成分解釋的變異比例。畫出兩條主軸,說明尺度選擇如何改變 PCA 認為最重要的方向。

參考資料