Skip to content

統計學不是背公式:它到底在替你判斷什麼?

2026年8月29日 1 分鐘
TL;DR 統計學的核心不是公式,而是判斷:描述資料、估計未知量、比較差異、檢查關聯,最後在不確定性下做決策。
目錄
  1. 統計學在處理資料和真相之間的距離
  2. 五種常見任務
  3. 一題教法比較,示範怎麼拆
  4. 同一套邏輯放到模型評估
  5. 讀這個系列時要練的動作
  6. 來源使用方式
  7. 題型辨識提示
  8. 常見錯誤
  9. 練習題
  10. 下一篇怎麼接
  11. 章節級參考對照
  12. 參考資料

English version

很多人第一次讀統計學,會把它讀成公式清單。平均數一條公式,變異數一條公式,信賴區間一條公式,p 值又一條公式。這種讀法有一個問題:公式越背越多,題目卻沒有變清楚。

考卷不會在題目前面幫你標好類型。它只會給你一段情境、一組數字,然後問「是否有差」「是否相關」「能不能推論」「該怎麼解釋」。你真正要做的第一件事,是判斷這題屬於哪一種統計任務。

如果這一步沒有建立起來,後面很容易變成關鍵字反射。看到「平均」就算平均,看到「顯著」就找 p 值,看到兩組數字就做 t-test,看到分類結果就報 accuracy。這些動作不一定錯,但它們都太早了。統計學先問的是:資料從哪裡來?你想知道的未知量是什麼?這個結論能推到多遠?

統計學在處理資料和真相之間的距離

手上的資料通常不是你真正關心的全部世界。你看到的是 40 位學生的成績,但你想知道教法對未來學生有沒有用。你看到的是 100 題測試集上的模型分數,但你想知道模型在未來任務上穩不穩。你看到的是某功能使用者留存率比較高,但你想知道是不是功能造成的效果。

這些問題都有同一個結構:資料在眼前,真相在資料外面。統計學的工作,就是讓你不要把眼前資料直接當成真相。

資料會有抽樣誤差。這次抽到的學生、題目、使用者,換一批可能結果不同。資料會有測量誤差。同一件事用不同工具量,可能得到不同數字。資料也會有偏誤。願意填問卷的人、本來就常用產品的人、被模型判錯的少數族群,都可能讓結果看起來比實際更單純。

所以統計答案很少只是一個數字。它通常還要交代這個數字從哪裡來、代表什麼、波動多大、能不能支持題目要求的結論。

五種常見任務

初學時可以先把統計題分成五種任務。

第一種是描述。題目只問這批資料長什麼樣,通常會用平均數、中位數、標準差、比例、圖表或列聯表。描述題的結論只限於眼前資料,不要偷偷推到母體。

第二種是估計。題目給你樣本,想知道母體平均、母體比例、迴歸係數或模型真實表現。這時樣本統計量只是起點,還要處理標準誤和信賴區間。

第三種是比較。兩組平均是否不同、兩個比例是否不同、多組平均能不能說有差,這些都屬於比較。比較題最容易犯的錯,是只看數字大小,沒有看差異相對於波動是否夠大。

第四種是關聯。兩個變數是否一起變動、兩個類別是否獨立、某個特徵和結果是否有關。關聯題要小心一件事:有關不代表有因果效果。

第五種是決策。是否拒絕虛無假設、是否採用新教法、是否上線新模型、是否相信 A/B test 的結果。這些題目會用前面四種任務的結果,但最後要寫成行動或判斷。

這五種任務會混在同一題裡。成熟的作答會先把任務拆開,再決定公式。

一題教法比較,示範怎麼拆

假設題目說:某班 40 位學生使用新教法後,平均分數是 72 分,標準差是 12 分。過去同類考試的平均分數是 68 分。請問新教法是否讓成績變好?

第一步,先看這是不是描述題。如果題目只問「這班學生表現如何」,答案可以停在平均 72、標準差 12,頂多再補分布形狀。這是描述眼前 40 人。

但題目問的是「新教法是否讓成績變好」。這就不只是描述,因為它想把 40 人的結果推到更大的教學情境。你要把母體平均定義清楚:使用新教法的同類學生,長期平均成績是否高於 68。

第二步,找樣本統計量。樣本平均是 72,和基準 68 差 4 分。這 4 分是觀察到的差距。

第三步,處理波動。標準差是 12,樣本數是 40,所以樣本平均不會每次都剛好等於母體平均。這裡需要標準誤,接著才能做信賴區間或單樣本檢定。

第四步,寫結論限制。比較穩的答案會說:「樣本平均高於過去平均,但需要用標準誤評估 4 分差距是否超出合理抽樣波動;若樣本具代表性且檢定結果支持,才可說新教法可能改善平均成績。」這種答案比「72 大於 68,所以有效」好很多。

你可以看到,這題真正考的是任務拆解:先描述眼前資料,再判斷是否能估計與比較,最後才寫決策。

同一套邏輯放到模型評估

把「新教法」換成「新模型」,問題幾乎一樣。

模型 A 在測試集上平均分數 72,舊模型平均 68。這只是眼前測試集的描述。你真正想知道的是:面對未來同類任務,新模型是否仍然比較好。

這時你要問的問題包括:測試集是否代表真實任務?分數的波動有多大?差 4 分是否穩定?錯誤是否集中在某些題型?如果新模型只在少數容易題型上進步,整體平均可能會掩蓋風險。

ML/AI 評估報告如果只寫「新模型提升 4 分」,統計上是不完整的。更好的寫法會補上測試集來源、樣本數、分數分布、信賴區間或重抽樣結果,以及不建議上線的限制條件。

這就是統計學在 ML/AI 裡的角色。metric 是起點,決策還需要資料來源、波動、限制與錯誤分布。

讀這個系列時要練的動作

讀每一篇時,先不要問「公式是什麼」。先問四個問題:

  1. 這題手上的資料是什麼?
  2. 題目真正想知道的未知量是什麼?
  3. 樣本結果可能因為抽樣或 noise 波動多少?
  4. 最後要做的是描述、估計、比較、關聯,還是決策?

你可以拿任何一題統計題練這四行。寫不出來,就代表你還沒準備好代公式。寫得出來,公式才會有位置。

來源使用方式

  • 官方考古題 PDF 只用來確認年份、科目名稱與題面,不把兩年題型當成完整範圍。
  • grad-exam-prep 備考頁用來對齊學習路線、題型入口與練習節奏,不視為官方標準答案。
  • OpenIntro、OpenStax 與其他開放教材用來核對公式、定義、假設與常見推導。
  • Stanford CS109 與 scikit-learn 文件用來補 ML/AI 對接:模型訓練、評估、實驗與不確定性報告。

題型辨識提示

  • 題目只要求整理眼前資料,先當描述統計。
  • 題目要從樣本推到母體、未來或未知參數,進入推論統計。
  • 題目問兩組是否有差,先判斷是平均、比例、成對資料,還是多組比較。
  • 題目問模型分數,先把分數當樣本統計量,不要直接當真實能力。

常見錯誤

  • 看到關鍵字就套公式,沒有先判斷統計任務。
  • 把樣本平均、樣本比例直接寫成母體真相。
  • 把關聯寫成因果。
  • 把模型測試分數寫成未來表現保證。

練習題

  1. 把「某班平均 78 分」改寫成描述問題、估計問題、比較問題、決策問題四種版本。
  2. 各寫一個 population、sample、parameter、statistic 的例子。
  3. 找一個模型排行榜,寫下它提供的是描述、估計、比較,還是決策證據。
  4. 用 80 字回答:統計學為什麼不是背公式?

下一篇怎麼接

下一篇會回到資料本身。你要先知道資料是類別、數值、計數還是時間序列,才知道能用平均數、比例、卡方、迴歸或時間切分。

章節級參考對照

  • OpenIntro / OpenStax:支撐 population、sample、parameter、statistic、描述統計與推論統計的基本定義。
  • Stanford CS109:支撐 uncertainty、資料生成與模型評估中的統計判斷。
  • scikit-learn:支撐 generalization、model evaluation 與測試分數解讀語境。

參考資料