假設檢定最容易學成一串按鍵:題目給平均數、標準差、樣本數,算出 t 值,再查 p 值。這樣可以拿到一部分分數,但遇到申論、判讀或 ML/AI 模型比較時,很快就會卡住。真正要先處理的是題目本身:你有沒有把它改寫成一個可以被資料挑戰的說法?
檢定的起點是原假設 H0。它通常代表保守立場,例如沒有差異、沒有效果、沒有關聯,或參數等於某個基準值。對立假設 H1 則描述你要找證據支持的方向:大於、小於,或不等於。
接著你先決定顯著水準 alpha,常見是 0.05。這個門檻要在看資料前決定,代表你事先願意承擔的第一型錯誤風險:在 H0 其實成立時,卻錯誤拒絕 H0。
p 值到底在說什麼
p 值的條件是「假設 H0 為真」。它問的是:如果 H0 真的成立,我們看到目前這麼極端,或更極端的資料結果,有多常見?
所以 p 值小,意思是目前資料在 H0 的世界裡很不尋常。這會給你拒絕 H0 的理由。p 值大,意思是目前資料沒有提供足夠證據反駁 H0;這不等於 H0 已被證明為真。
考試作答可以照這個流程寫:
- 定義參數。
- 寫出
H0與H1。 - 選定
alpha。 - 選檢定統計量與參考分配。
- 算 p 值或比較 critical value。
- 用題目語境寫結論。
最後一步不能省。只寫 reject H0 很像把計算丟給閱卷者自己翻譯;完整答案要回到題目,例如「資料提供平均處理時間低於 30 秒的統計證據」。
手算例題:單一平均數 t 檢定
某系統標稱平均處理時間為 30 秒。改善流程後抽樣 16 筆,得到樣本平均 xbar = 28 秒、樣本標準差 s = 4 秒。檢定平均處理時間是否低於 30 秒,令 alpha = 0.05。
先定義母體平均處理時間為 mu。因為題目問「是否低於」,所以是左尾檢定:
H0: mu = 30
H1: mu < 30
母體標準差未知,用樣本標準差,走 t 檢定。標準誤是:
SE = s / sqrt(n) = 4 / sqrt(16) = 1
檢定統計量:
t = (xbar - 30) / SE = (28 - 30) / 1 = -2
自由度:
df = n - 1 = 15
查 t 分配,左尾 t = -2 的 p 值約在 0.03 左右,低於 0.05。結論可以寫:「在 5% 顯著水準下,資料提供足夠統計證據支持平均處理時間低於 30 秒。」
這句話仍然不代表改善幅度在實務上一定夠大。平均少 2 秒是否值得上線,還要看成本、使用者體感、系統穩定度,以及信賴區間或效果量。
第一型與第二型錯誤怎麼放進語境
第一型錯誤是 H0 成立卻拒絕 H0。以上面的系統為例,就是流程其實沒有變快,卻判定它變快了。產品實驗中,這可能導致你上線一個沒有真實效果的改版。
第二型錯誤是 H1 成立卻沒有拒絕 H0。也就是流程其實變快了,但你的樣本沒有看出來。產品實驗中,這可能讓你錯過有用的功能。
考試常把這兩種錯誤寫得很抽象;你可以先用 H0 的語境翻譯一遍,再寫錯誤後果。這樣比較不會把兩者背反。
這在 ML / AI 哪裡會用到
模型比較其實常常是在做檢定思維。模型 A 在測試集上 accuracy 0.84,模型 B 是 0.86,表面上 B 較高;但如果測試集只有 200 題,這個 0.02 的差距可能只是抽樣波動。
更細一點看,如果兩個模型回答的是同一批題目,資料是成對的。此時應該看每題 A 和 B 的差異,而不是把兩個 accuracy 當成完全獨立的樣本。這會影響標準誤、p 值和結論。
大型模型評估還有多重比較問題。你一次比較十幾個模型、幾十個任務、很多 prompt 版本時,只要檢定做得夠多,就容易出現偶然顯著的結果。統計檢定的作用,是逼你把分數、樣本設計、錯誤風險與實務門檻一起攤開。
常見錯誤
- 把 p 值說成 H0 為真的機率。
- 看完資料才決定要做單尾或雙尾檢定。
- p 值大就寫「接受 H0」或「證明沒有差異」。
- 有統計顯著就直接等同於實務上值得採用。
- 比較模型時忽略同一批題目形成的成對結構。
練習題
- 對「平均處理時間是否低於 30 秒」寫出參數、H0、H1、alpha 與結論句模板。
- 給定
t = -2.1、df = 15、p = 0.026,在alpha = 0.05下寫出統計結論與語境結論。 - 用產品 A/B test 各寫一個第一型錯誤與第二型錯誤的後果。
- 設計一個兩模型比較情境,說明 p 值不能回答哪些產品決策問題。
下一篇怎麼接
這篇用單一平均數建立檢定流程。下一篇會把問題推到兩組資料:兩班成績、兩個模型、兩個版本的轉換率,到底該用獨立兩樣本、成對比較,還是兩比例檢定?
章節級參考對照
- OpenIntro / OpenStax:H0/H1、p 值、t 檢定與錯誤型態。
- Stanford CS109:hypothesis testing 與 uncertainty 下的決策。
- scikit-learn:模型評估與 validation 結果判讀。
參考資料
Loading...