目錄
你如果是為了研究所考試開始讀統計學,最容易走錯的路,是第一天就打開考古題,看到一題信賴區間就背信賴區間,看到一題卡方就背卡方。這樣短期好像有進度,因為每晚都多背了幾個公式;到真正寫題目時,反而不知道第一步要判斷什麼。
另一條常見的岔路,是一開始就把統計學當成數學系課程讀。從排列組合、機率分布、期望值一路讀到估計量性質,每一節都看得懂,合起來卻不知道和考卷上的題目有什麼關係。你會算,但不知道何時該算;你知道公式,但不知道題目為什麼需要這個公式。
這個系列要解的問題很具體:初學者怎麼把統計學讀成一套可用的判斷流程。可用,意思是看到考題時能判斷題型;看到模型評估報告時能看出分數背後的不確定性;看到 A/B testing 或資料偏差時,知道問題不是多算幾個平均數就能結束。
先把統計學看成四個問題
統計學的章節很多,但初學時先不要把它看成一排工具。先把它看成四個問題。
第一個問題是:手上的資料長什麼樣?這一步會用到資料型態、平均數、中位數、變異數、標準差、比例、列聯表。你要先知道資料是類別、數值、計數、時間序列,才知道後面能不能算平均、能不能做卡方、能不能直接切訓練集和測試集。
第二個問題是:如果世界重來一次,結果會怎麼變?這一步會用到機率、隨機變數、分布、期望值、變異數。統計學關心的不只是這次樣本算出 82%,也關心如果換一批樣本,82% 會不會變成 78% 或 86%。
第三個問題是:能不能從樣本推回更大的母體?這一步會用到抽樣、標準誤、中央極限定理、信賴區間、假設檢定。考試裡很多題目的關鍵都在這裡:你手上永遠只有樣本,但題目想問的是母體平均、母體比例、兩組真實差異。
第四個問題是:這個判斷要怎麼變成決策?這一步會用到迴歸、模型比較、實驗設計、因果推論、A/B testing。p 值只是中間結果,最後仍要回答能不能說新方法比較好、能不能上線新模型、能不能把觀察到的差異當成效果。
這四個問題串起來,就是本系列的主線。
讀書順序不要照公式難度排
對初學者來說,讀書順序要跟題目裡的判斷順序一致。先學題目一開始就需要的判斷,再學支撐那些判斷的公式。
第一層先讀資料和機率。你要能分辨平均數和比例、標準差和標準誤、獨立和互斥、條件機率和貝氏反推。這些如果不清楚,後面每個工具都會被誤用。
第二層讀抽樣和推論。信賴區間、假設檢定、兩母體比較、卡方、ANOVA,看起來是不同公式,底層其實都在處理同一件事:樣本結果和母體真相之間有距離。你要學的是何時用哪個工具,以及答案要怎麼寫得保守。
第三層讀估計和模型。迴歸、MLE、Bayesian inference、regularization、bootstrap、A/B testing、因果推論,會把統計學接到 ML/AI。現代模型工作每天都在問統計問題:分數差距是否穩定、測試集是否代表真實任務、資料偏差是否讓模型看起來比實際更好。
這樣排有一個好處:你不會把每章讀成孤島。信賴區間不是單獨一章,它接在標準誤後面;假設檢定不是背 p 值,它接在抽樣分布後面;regularization 不是 ML 的神祕技巧,它可以接回 MAP 和 prior。
一題模型比較題,示範統計讀法
假設題目給你一個情境:模型 A 在 100 題測試題答對 82 題,模型 B 答對 78 題。問你能不能說 A 比 B 好。
直覺上,A 的 82% 高於 B 的 78%。如果只看數字,答案很像是 A 比較好。統計學要你慢下來,因為這 4 題差距可能來自模型能力,也可能只是測試題抽樣造成的波動。
第一步先判斷資料型態。每一題只有答對或答錯,所以單一模型的表現可以先看成比例。A 的樣本正確率是 0.82,B 的樣本正確率是 0.78。
第二步找真正想推論的量。你不是只想知道這 100 題上誰高;你想知道面對同一類未來題目時,A 的真實正確率是否高於 B。這就把題目從描述統計推進到統計推論。
第三步看比較方式。如果 A 和 B 是在同一批 100 題上作答,這是成對比較,因為每一題同時產生 A 和 B 的結果。此時要看哪些題 A 對 B 錯、哪些題 A 錯 B 對,而不是把兩個 100 題結果當成完全獨立。如果 A 和 B 用的是不同測試題,才比較接近兩個比例的獨立比較。
第四步寫結論。比較好的考試答案會長這樣:「A 的樣本正確率比 B 高 4 個百分點,但仍需根據測試設計判斷使用成對比較或兩比例比較;只看樣本正確率不足以宣稱 A 在母體任務上較好。」這句話沒有急著套公式,卻已經把資料、未知量、工具選擇和結論限制都交代出來。
這就是統計學的讀法。公式會用到,但公式不是第一步。
考試真正想看的是題型辨識
考試題目通常不會只測你能不能把數字代進公式。它會測你有沒有看出題目的結構。
題目問「平均分數是否高於 70」,你要想到單一母體平均。題目問「兩種教法是否有差」,你要看是獨立兩組還是同一批人前後測。題目給一張類別表,問性別和選課是否有關,你要想到卡方獨立性檢定。題目問多組平均能不能直接兩兩比,你要知道 ANOVA 在控制重複比較的錯誤率。
這些判斷比背公式更早發生。公式背錯當然會失分,但題型看錯會讓整題走錯方向。初學時應該練的是「看到題目先說出它是哪一類問題」,再開始算。
所以本系列每篇都會保留三個固定任務:先說這篇處理哪種題型,再用一個算例走完,最後指出它在 ML/AI 的哪個流程會出現。你讀到的概念會落在具體工作流裡,例如模型評估、資料檢查、線上實驗或監控報告。
這套統計底座怎麼接到 ML/AI
ML/AI 裡最常被忽略的統計問題,是大家太快相信單一分數。
模型在 benchmark 上贏 1 個百分點,代表它真的比較好嗎?要看測試集大小、題型分布、抽樣波動和是否重複測試。新推薦模型上線後點擊率提高,代表模型造成提升嗎?要看是否隨機分派、是否有季節因素、是否有使用者族群差異。資料集缺了某些族群的標籤,代表只要補平均值就好嗎?要看缺資料機制,因為缺失本身可能就是偏誤來源。
這些問題用到的,多半是統計學的基本功。描述統計幫你檢查資料;機率幫你理解分類器的 precision 和 recall;抽樣分布幫你理解 benchmark 分數波動。信賴區間和檢定幫你比較模型;迴歸和實驗設計幫你解釋產品改動;Bayesian 和 bootstrap 幫你在資料少或公式難寫時處理不確定性。
讀完這個系列,你不會因此變成統計學家,也不會只靠 53 篇就取代完整課本。但你應該能建立一個穩定的骨架:知道考題從哪裡下手,也知道 ML/AI 報告裡哪些分數不能照單全收。
怎麼使用這個系列
如果你是零基礎,先照順序讀第 1 到第 20 篇。這一段會把資料、機率、分布、抽樣、信賴區間、檢定、迴歸和基本考題辨識建立起來。讀的時候不要只畫線,每篇都要自己寫一次「這題在問什麼、資料是什麼、未知量是什麼、工具是什麼」。
如果你已經修過統計學,但看到題目仍然不穩,可以從第 9 篇信賴區間和第 10 篇假設檢定開始,往後接兩母體比較、卡方、ANOVA、迴歸和混合題辨識。這條路線比較適合考前補題型。
如果你想把統計接到 ML/AI,就不要跳過前面的推論。第 30 篇以後會談 asymptotic normality、delta method、bootstrap、Bayesian、regularization、A/B testing、因果推論和評估報告。這些主題在 ML/AI 裡很常見,但如果沒有前面的抽樣和不確定性概念,會變成另一批要背的名詞。
來源使用方式
- 官方考古題 PDF 只用來確認年份、科目名稱與題面,不把兩年題型當成完整範圍。
- grad-exam-prep 備考頁用來對齊學習路線、題型入口與練習節奏,不視為官方標準答案。
- OpenIntro、OpenStax 與其他開放教材用來核對公式、定義、假設與常見推導。
- Stanford CS109 與 scikit-learn 文件用來補 ML/AI 對接:模型訓練、評估、實驗與不確定性報告。
題型辨識提示
- 先判斷題目是在問描述、估計、比較、關聯、預測,還是決策。
- 題目給的是考古題年份或題面時,回官方 PDF 核對,不用備考站整理取代題面。
- 每讀完一篇,都要能說出它在 ML/AI 的哪個流程出現,例如模型評估、資料檢查、A/B testing、因果推論或監控。
常見錯誤
- 看到關鍵字就套公式,沒有先判斷資料型態。
- 把樣本正確率、樣本平均數直接講成母體真相。
- 把兩年考古題當成完整考試範圍。
- 把 ML/AI 接點誤解成考試會直接考 AI 名詞。
練習題
- 拿一題你手上的統計題,先不要算。只寫四行:資料、統計量、未知量、決策。
- 找一個模型排行榜,寫下你會追問的三件事:測試集大小、分數波動、題型分布。
- 把「A 模型 82%,B 模型 78%」改寫成一段保守結論,不能直接說 A 一定比較好。
- 把本系列 53 篇分成三欄:考試基礎、推論工具、ML/AI 應用。每欄圈出你最不熟的兩篇。
下一篇怎麼接
下一篇會先問一個更根本的問題:統計學到底在替你判斷什麼。那篇會把描述、估計、比較、關聯和決策分開,讓你之後看到公式時知道它正在服務哪一種任務。
章節級參考對照
- OpenIntro / OpenStax:支撐基礎統計順序、描述統計、機率、抽樣與推論術語。
- grad-exam-prep:只用來對齊台大資管備考頁入口與練習動線。
- Stanford CS109 / scikit-learn:支撐模型評估、metric 與不確定性接法。
參考資料
Loading...