Skip to content

假設檢定從 H0 到 p 值,到底要做哪個決策?

2026年8月29日 1 分鐘
TL;DR 假設檢定是一套在不確定資料中做決策的流程:先寫 H0/H1,再用檢定統計量與 p 值判斷資料是否足夠反駁原假設。
目錄
  1. p 值到底在說什麼
  2. 手算例題:單一平均數 t 檢定
  3. 第一型與第二型錯誤怎麼放進語境
  4. 這在 ML / AI 哪裡會用到
  5. 常見錯誤
  6. 練習題
  7. 下一篇怎麼接
  8. 章節級參考對照
  9. 參考資料

English version

假設檢定最容易學成一串按鍵:題目給平均數、標準差、樣本數,算出 t 值,再查 p 值。這樣可以拿到一部分分數,但遇到申論、判讀或 ML/AI 模型比較時,很快就會卡住。真正要先處理的是題目本身:你有沒有把它改寫成一個可以被資料挑戰的說法?

檢定的起點是原假設 H0。它通常代表保守立場,例如沒有差異、沒有效果、沒有關聯,或參數等於某個基準值。對立假設 H1 則描述你要找證據支持的方向:大於、小於,或不等於。

接著你先決定顯著水準 alpha,常見是 0.05。這個門檻要在看資料前決定,代表你事先願意承擔的第一型錯誤風險:在 H0 其實成立時,卻錯誤拒絕 H0。

p 值到底在說什麼

p 值的條件是「假設 H0 為真」。它問的是:如果 H0 真的成立,我們看到目前這麼極端,或更極端的資料結果,有多常見?

所以 p 值小,意思是目前資料在 H0 的世界裡很不尋常。這會給你拒絕 H0 的理由。p 值大,意思是目前資料沒有提供足夠證據反駁 H0;這不等於 H0 已被證明為真。

考試作答可以照這個流程寫:

  1. 定義參數。
  2. 寫出 H0H1
  3. 選定 alpha
  4. 選檢定統計量與參考分配。
  5. 算 p 值或比較 critical value。
  6. 用題目語境寫結論。

最後一步不能省。只寫 reject H0 很像把計算丟給閱卷者自己翻譯;完整答案要回到題目,例如「資料提供平均處理時間低於 30 秒的統計證據」。

手算例題:單一平均數 t 檢定

某系統標稱平均處理時間為 30 秒。改善流程後抽樣 16 筆,得到樣本平均 xbar = 28 秒、樣本標準差 s = 4 秒。檢定平均處理時間是否低於 30 秒,令 alpha = 0.05

先定義母體平均處理時間為 mu。因為題目問「是否低於」,所以是左尾檢定:

H0: mu = 30
H1: mu < 30

母體標準差未知,用樣本標準差,走 t 檢定。標準誤是:

SE = s / sqrt(n) = 4 / sqrt(16) = 1

檢定統計量:

t = (xbar - 30) / SE = (28 - 30) / 1 = -2

自由度:

df = n - 1 = 15

查 t 分配,左尾 t = -2 的 p 值約在 0.03 左右,低於 0.05。結論可以寫:「在 5% 顯著水準下,資料提供足夠統計證據支持平均處理時間低於 30 秒。」

這句話仍然不代表改善幅度在實務上一定夠大。平均少 2 秒是否值得上線,還要看成本、使用者體感、系統穩定度,以及信賴區間或效果量。

第一型與第二型錯誤怎麼放進語境

第一型錯誤是 H0 成立卻拒絕 H0。以上面的系統為例,就是流程其實沒有變快,卻判定它變快了。產品實驗中,這可能導致你上線一個沒有真實效果的改版。

第二型錯誤是 H1 成立卻沒有拒絕 H0。也就是流程其實變快了,但你的樣本沒有看出來。產品實驗中,這可能讓你錯過有用的功能。

考試常把這兩種錯誤寫得很抽象;你可以先用 H0 的語境翻譯一遍,再寫錯誤後果。這樣比較不會把兩者背反。

這在 ML / AI 哪裡會用到

模型比較其實常常是在做檢定思維。模型 A 在測試集上 accuracy 0.84,模型 B 是 0.86,表面上 B 較高;但如果測試集只有 200 題,這個 0.02 的差距可能只是抽樣波動。

更細一點看,如果兩個模型回答的是同一批題目,資料是成對的。此時應該看每題 A 和 B 的差異,而不是把兩個 accuracy 當成完全獨立的樣本。這會影響標準誤、p 值和結論。

大型模型評估還有多重比較問題。你一次比較十幾個模型、幾十個任務、很多 prompt 版本時,只要檢定做得夠多,就容易出現偶然顯著的結果。統計檢定的作用,是逼你把分數、樣本設計、錯誤風險與實務門檻一起攤開。

常見錯誤

  • 把 p 值說成 H0 為真的機率。
  • 看完資料才決定要做單尾或雙尾檢定。
  • p 值大就寫「接受 H0」或「證明沒有差異」。
  • 有統計顯著就直接等同於實務上值得採用。
  • 比較模型時忽略同一批題目形成的成對結構。

練習題

  1. 對「平均處理時間是否低於 30 秒」寫出參數、H0、H1、alpha 與結論句模板。
  2. 給定 t = -2.1df = 15p = 0.026,在 alpha = 0.05 下寫出統計結論與語境結論。
  3. 用產品 A/B test 各寫一個第一型錯誤與第二型錯誤的後果。
  4. 設計一個兩模型比較情境,說明 p 值不能回答哪些產品決策問題。

下一篇怎麼接

這篇用單一平均數建立檢定流程。下一篇會把問題推到兩組資料:兩班成績、兩個模型、兩個版本的轉換率,到底該用獨立兩樣本、成對比較,還是兩比例檢定?

章節級參考對照

  • OpenIntro / OpenStax:H0/H1、p 值、t 檢定與錯誤型態。
  • Stanford CS109:hypothesis testing 與 uncertainty 下的決策。
  • scikit-learn:模型評估與 validation 結果判讀。

參考資料