考試寫到信賴區間時,很多人會很快把答案寫成 xbar ± t* s / sqrt(n),上下界也算得出來。問題通常出在下一行:題目要你解釋,或要你比較兩個估計結果時,你才發現自己其實只背了外型。
信賴區間的核心是把一個點估計補上它的不確定性。樣本平均 82 看起來像一個精準答案,但它只來自一批樣本;換一批樣本,平均數會動。信賴區間就是在說:如果我們用這套抽樣與計算程序重複很多次,大約有多少比例的區間會蓋到真正的母體參數。
這句話很重要,因為母體平均數本身在傳統 frequentist 架構下是固定的。抽樣前會變的是區間,抽樣後你手上的區間已經固定了。因此考試最常扣分的句子是:「母體平均有 95% 機率落在這個區間。」比較穩的寫法是:「用這個方法建立的 95% 信賴區間為 A 到 B;在相同條件下重複抽樣,這類方法長期約有 95% 的區間會包含母體平均。」
先看區間由哪三塊組成
大部分入門信賴區間都長得像:
估計值 ± 臨界值 × 標準誤
估計值是你用樣本推母體的中心,例如樣本平均 xbar 或樣本比例 phat。標準誤描述這個估計值在重複抽樣下會抖多大;樣本數越大,標準誤通常越小。臨界值由信心水準和參考分配決定,95% 會比 90% 寬,因為你要求方法長期蓋到參數的比例更高。
平均數題要先看母體標準差 sigma 是否已知。已知時常用 z 區間:
xbar ± z* sigma / sqrt(n)
母體標準差未知,而且題目給的是樣本標準差 s,常用 t 區間:
xbar ± t* s / sqrt(n)
比例題常見近似區間是:
phat ± z* sqrt(phat(1 - phat) / n)
公式看起來很多,其實只是在換估計值和標準誤。解題時不要先問「背哪個公式」,要先問資料型態是平均數還是比例、母體標準差是否已知、樣本數與近似條件是否合理。
手算例題:平均數的 t 信賴區間
題目給一批樣本,樣本平均 xbar = 82,樣本標準差 s = 10,樣本數 n = 25。請建立母體平均數的 95% 信賴區間。
第一步先判斷:這是平均數題,母體標準差未知,題目給樣本標準差,所以用 t 區間。自由度是:
df = n - 1 = 24
第二步算標準誤:
SE = s / sqrt(n) = 10 / sqrt(25) = 2
第三步找 95% t 臨界值。自由度 24 時,雙尾 95% 的 t* 約為 2.064。誤差界是:
margin = 2.064 × 2 = 4.128
所以區間是:
82 ± 4.128 = [77.872, 86.128]
答案不要只停在這裡。你還要補一句語境解釋:「根據這 25 筆樣本,母體平均數的 95% 信賴區間約為 77.872 到 86.128。」如果題目要求白話說明,再補上這是估計程序的長期覆蓋率,不是把母體平均數當成隨機變數。
看到題目時怎麼判斷
題目出現「估計範圍」、「誤差界」、「信心水準」、「confidence interval」時,優先想到信賴區間。接著看它要估的是平均數、比例、變異數,或兩組差異。這一步會決定估計值和標準誤。
平均數題如果給 sigma,通常走 z;給 s 且沒有母體標準差,通常走 t。比例題則要注意樣本數是否夠大,因為 phat ± z*SE 是常態近似。兩組比較會在下一篇展開,因為兩組資料是否獨立會直接改變標準誤。
這在 ML / AI 哪裡會用到
模型評估也有抽樣波動。假設一個分類模型在 200 題測試集上答對 168 題,accuracy 是:
phat = 168 / 200 = 0.84
用比例的近似標準誤:
SE = sqrt(0.84 × 0.16 / 200) ≈ 0.026
95% 近似區間是:
0.84 ± 1.96 × 0.026 ≈ [0.789, 0.891]
如果另一個模型 accuracy 是 0.86,不能只看 0.86 大於 0.84 就宣稱它比較好。你需要看評估設計:兩個模型是不是跑同一批題目?每題是否成對比較?測試集是否代表未來資料?區間和檢定不會替你保證模型真的比較強,但它會逼你把「分數差距」和「抽樣不確定性」分開。
這也是很多 benchmark 報告應該補上的東西。排行榜只列單一分數,讀者會誤以為差 0.5% 或 1% 一定有意義;但在樣本數小、題目偏、模型輸出不穩的情況下,分數差距可能只是評估資料的波動。
常見錯誤
- 把 95% 信賴區間解釋成「母體參數有 95% 機率在區間內」。
- 沒看母體標準差是否已知,直接把 z 和 t 混用。
- 只寫上下界,沒有說明估計的是哪個母體參數。
- 看到模型分數就直接排名,沒有檢查測試集大小與不確定性。
- 把兩年考古題出現的形式當成完整考試範圍。
練習題
- 樣本平均 70、樣本標準差 8、樣本數 16,建立 95% t 信賴區間,寫出標準誤與誤差界。
- 如果樣本數從 16 增加到 64,其他條件不變,區間寬度會怎麼變?請用標準誤說明。
- 寫一個正確的 95% 信賴區間解釋,再寫一個常見錯誤解釋。
- 某模型在 500 題上 accuracy 0.91,請設計一個近似區間,並說明它對模型比較有什麼幫助。
下一篇怎麼接
信賴區間回答「參數可能在哪個範圍」。下一篇會進入假設檢定,處理另一種考試常見問法:如果某個說法原本成立,現在這批資料是否足以讓我們推翻它?
章節級參考對照
- OpenIntro / OpenStax:平均數、比例信賴區間、標準誤與解釋限制。
- Stanford CS109:抽樣分配與 uncertainty 的直覺。
- scikit-learn:模型評估指標與評估報告語境。
參考資料
Loading...