Skip to content

信賴區間怎麼寫,才不是只背上下界公式?

2026年8月29日 1 分鐘
TL;DR 信賴區間把點估計放回抽樣波動裡看;會寫上下界只是第一步,真正要會的是解釋標準誤、臨界值與 coverage。
目錄
  1. 先看區間由哪三塊組成
  2. 手算例題:平均數的 t 信賴區間
  3. 看到題目時怎麼判斷
  4. 這在 ML / AI 哪裡會用到
  5. 常見錯誤
  6. 練習題
  7. 下一篇怎麼接
  8. 章節級參考對照
  9. 參考資料

English version

考試寫到信賴區間時,很多人會很快把答案寫成 xbar ± t* s / sqrt(n),上下界也算得出來。問題通常出在下一行:題目要你解釋,或要你比較兩個估計結果時,你才發現自己其實只背了外型。

信賴區間的核心是把一個點估計補上它的不確定性。樣本平均 82 看起來像一個精準答案,但它只來自一批樣本;換一批樣本,平均數會動。信賴區間就是在說:如果我們用這套抽樣與計算程序重複很多次,大約有多少比例的區間會蓋到真正的母體參數。

這句話很重要,因為母體平均數本身在傳統 frequentist 架構下是固定的。抽樣前會變的是區間,抽樣後你手上的區間已經固定了。因此考試最常扣分的句子是:「母體平均有 95% 機率落在這個區間。」比較穩的寫法是:「用這個方法建立的 95% 信賴區間為 A 到 B;在相同條件下重複抽樣,這類方法長期約有 95% 的區間會包含母體平均。」

先看區間由哪三塊組成

大部分入門信賴區間都長得像:

估計值 ± 臨界值 × 標準誤

估計值是你用樣本推母體的中心,例如樣本平均 xbar 或樣本比例 phat。標準誤描述這個估計值在重複抽樣下會抖多大;樣本數越大,標準誤通常越小。臨界值由信心水準和參考分配決定,95% 會比 90% 寬,因為你要求方法長期蓋到參數的比例更高。

平均數題要先看母體標準差 sigma 是否已知。已知時常用 z 區間:

xbar ± z* sigma / sqrt(n)

母體標準差未知,而且題目給的是樣本標準差 s,常用 t 區間:

xbar ± t* s / sqrt(n)

比例題常見近似區間是:

phat ± z* sqrt(phat(1 - phat) / n)

公式看起來很多,其實只是在換估計值和標準誤。解題時不要先問「背哪個公式」,要先問資料型態是平均數還是比例、母體標準差是否已知、樣本數與近似條件是否合理。

手算例題:平均數的 t 信賴區間

題目給一批樣本,樣本平均 xbar = 82,樣本標準差 s = 10,樣本數 n = 25。請建立母體平均數的 95% 信賴區間。

第一步先判斷:這是平均數題,母體標準差未知,題目給樣本標準差,所以用 t 區間。自由度是:

df = n - 1 = 24

第二步算標準誤:

SE = s / sqrt(n) = 10 / sqrt(25) = 2

第三步找 95% t 臨界值。自由度 24 時,雙尾 95% 的 t* 約為 2.064。誤差界是:

margin = 2.064 × 2 = 4.128

所以區間是:

82 ± 4.128 = [77.872, 86.128]

答案不要只停在這裡。你還要補一句語境解釋:「根據這 25 筆樣本,母體平均數的 95% 信賴區間約為 77.872 到 86.128。」如果題目要求白話說明,再補上這是估計程序的長期覆蓋率,不是把母體平均數當成隨機變數。

看到題目時怎麼判斷

題目出現「估計範圍」、「誤差界」、「信心水準」、「confidence interval」時,優先想到信賴區間。接著看它要估的是平均數、比例、變異數,或兩組差異。這一步會決定估計值和標準誤。

平均數題如果給 sigma,通常走 z;給 s 且沒有母體標準差,通常走 t。比例題則要注意樣本數是否夠大,因為 phat ± z*SE 是常態近似。兩組比較會在下一篇展開,因為兩組資料是否獨立會直接改變標準誤。

這在 ML / AI 哪裡會用到

模型評估也有抽樣波動。假設一個分類模型在 200 題測試集上答對 168 題,accuracy 是:

phat = 168 / 200 = 0.84

用比例的近似標準誤:

SE = sqrt(0.84 × 0.16 / 200) ≈ 0.026

95% 近似區間是:

0.84 ± 1.96 × 0.026 ≈ [0.789, 0.891]

如果另一個模型 accuracy 是 0.86,不能只看 0.86 大於 0.84 就宣稱它比較好。你需要看評估設計:兩個模型是不是跑同一批題目?每題是否成對比較?測試集是否代表未來資料?區間和檢定不會替你保證模型真的比較強,但它會逼你把「分數差距」和「抽樣不確定性」分開。

這也是很多 benchmark 報告應該補上的東西。排行榜只列單一分數,讀者會誤以為差 0.5% 或 1% 一定有意義;但在樣本數小、題目偏、模型輸出不穩的情況下,分數差距可能只是評估資料的波動。

常見錯誤

  • 把 95% 信賴區間解釋成「母體參數有 95% 機率在區間內」。
  • 沒看母體標準差是否已知,直接把 z 和 t 混用。
  • 只寫上下界,沒有說明估計的是哪個母體參數。
  • 看到模型分數就直接排名,沒有檢查測試集大小與不確定性。
  • 把兩年考古題出現的形式當成完整考試範圍。

練習題

  1. 樣本平均 70、樣本標準差 8、樣本數 16,建立 95% t 信賴區間,寫出標準誤與誤差界。
  2. 如果樣本數從 16 增加到 64,其他條件不變,區間寬度會怎麼變?請用標準誤說明。
  3. 寫一個正確的 95% 信賴區間解釋,再寫一個常見錯誤解釋。
  4. 某模型在 500 題上 accuracy 0.91,請設計一個近似區間,並說明它對模型比較有什麼幫助。

下一篇怎麼接

信賴區間回答「參數可能在哪個範圍」。下一篇會進入假設檢定,處理另一種考試常見問法:如果某個說法原本成立,現在這批資料是否足以讓我們推翻它?

章節級參考對照

  • OpenIntro / OpenStax:平均數、比例信賴區間、標準誤與解釋限制。
  • Stanford CS109:抽樣分配與 uncertainty 的直覺。
  • scikit-learn:模型評估指標與評估報告語境。

參考資料