Skip to content

看到一份資料,第一眼要先看哪些統計量?

2026年8月29日 1 分鐘
TL;DR 資料型態決定你能用什麼統計工具。這篇從類別、數值、計數與時間資料開始,說明平均數、比例、變異數、列聯表在考題和 ML 資料檢查中的用途。
目錄
  1. 第一眼先分資料型態
  2. 描述統計不是把所有數字算一遍
  3. 一個小資料例子
  4. 常見題型怎麼辨識
  5. 這在 ML / AI 哪裡會用到
  6. 來源使用方式
  7. 題型辨識提示
  8. 常見錯誤
  9. 練習題
  10. 下一篇怎麼接
  11. 章節級參考對照
  12. 參考資料

English version

很多統計題的第一個陷阱,不在計算,而在資料型態。題目給你一串數字,你以為一定要算平均;題目給你一張表,你以為只是在數人數;題目給你模型正確率,你以為那就是模型能力。資料型態一旦判錯,後面選公式通常也會跟著錯。

準備考試時,描述統計常被低估。大家覺得平均數、中位數、標準差太簡單,真正要背的是信賴區間和檢定。可是信賴區間和檢定都站在描述統計後面。你若不知道資料是類別還是數值、是否偏態、有沒有離群值、兩組樣本是否平衡,後面的推論就沒有穩定地基。

ML/AI 也是一樣。訓練模型前不先看資料,後面再精緻的模型都可能只是把資料偏差學得更漂亮。label 是否失衡、feature 是否有極端值、missing rate 是否集中在某些族群,這些都會影響模型評估能不能相信。

第一眼先分資料型態

拿到資料時,先問它是哪一種變數。

類別資料是在分組,例如科系、性別、是否錄取、答對或答錯。這類資料通常看次數、比例、列聯表,不適合直接算平均。二元類別雖然可以用 0 和 1 編碼,但它的平均其實是在講比例。

順序資料有大小順序,但相鄰差距不一定相等。例如滿意度 1 到 5、排名、問卷量表。你可以比較高低,也可以在某些情境下用平均摘要,但解釋時要小心,因為 1 到 2 的差距不一定等於 4 到 5。

數值資料可以做加減和平均,例如分數、身高、時間、金額。數值資料才適合談平均數、標準差、變異數、四分位距。即使如此,也要看分布形狀。收入這類資料常有偏態,只看平均會被少數極端值拉動。

計數資料是某件事發生幾次,例如一天客服工單數、每分鐘請求數、某類錯誤出現次數。計數資料不能小於 0,常常右偏,後面可能會接 Poisson 或其他 count model。

時間序列資料多了一個順序限制。今天、明天、下週不是可以任意打散的觀測值。只要資料有時間相依性,train/test split、趨勢判讀、異常偵測都要另外處理。

描述統計不是把所有數字算一遍

描述統計的任務,是用少數摘要看出資料結構。

中心位置回答「典型值在哪裡」。平均數適合比較對稱、沒有極端值的數值資料;中位數在偏態或有離群值時比較穩。分散程度回答「資料有多不穩」。標準差描述資料圍繞平均數的波動,四分位距則比較不受極端值影響。

比例回答「類別組成如何」。如果 95% 樣本都是同一類,分類模型就算什麼都不學,也可能有很高 accuracy。列聯表回答「兩個類別變數如何交錯」。例如錄取與否對上科系,會讓你看到差異是否集中在某些組別。

圖表回答的是文字摘要看不出的形狀。直方圖看分布,箱型圖看中位數、四分位與離群值,散佈圖看兩個數值變數是否一起變動。考試不一定要畫得很漂亮,但你要知道每種圖在看什麼。

一個小資料例子

假設某模型在 10 題上的信心分數是:

0.91、0.88、0.86、0.84、0.81、0.79、0.76、0.72、0.30、0.18

如果只算平均,大約是 0.705。這個數字會讓你覺得模型整體信心中等偏高。但這個摘要掩蓋了一件事:前 8 題信心都在 0.72 以上,最後 2 題明顯掉下來。

中位數會更能描述典型題目。排序後第 5 和第 6 個值是 0.79 和 0.81,中位數是 0.80。平均數比中位數低,提醒你低分尾巴把平均往下拉。

接著看 range。最大值 0.91,最小值 0.18,範圍很大。若畫箱型圖,0.18 和 0.30 會逼你回去看題目本身:是不是某種題型、某種語言、某種格式讓模型不確定?

考試答案可以這樣寫:「這是連續數值資料,應先看中心、分散與離群值。平均信心約 0.705,但中位數約 0.80,表示少數低信心題目拉低平均;若要評估模型穩定性,應進一步檢查低分題型,而不是只報平均。」

這個例子看似簡單,卻示範了一個重要習慣:描述統計要讓你回到資料,而不是讓你離資料更遠。

常見題型怎麼辨識

題目給一串分數、時間、金額,通常先看數值摘要。你要想到平均數、中位數、標準差、四分位距,以及是否有離群值。

題目給錄取與否、是否購買、答對答錯,通常先看比例。若題目還給另一個類別,例如科系或版本,就要想到列聯表,後面可能接卡方檢定。

題目問「兩個變數是否有關」,先看變數型態。兩個數值變數可能看 correlation 或 regression;兩個類別變數可能看 contingency table;一個類別加一個數值變數,可能看分組平均或箱型圖。

題目如果直接要求「是否可推論到母體」,描述統計就只是第一步。你要把樣本摘要接到標準誤、信賴區間或假設檢定。

這在 ML / AI 哪裡會用到

ML pipeline 的第一張表,應該就是 dataset summary。

對 feature,你要看型態、範圍、平均或比例、缺失率、極端值。對 label,你要看類別比例。對切分後的 train/test,你要看分布是否接近。若訓練資料裡某類樣本佔 90%,測試資料只有 60%,模型表現落差可能來自資料分布改變。

模型訓練後,描述統計也沒有結束。你要看 score distribution、error distribution、subgroup performance。整體 accuracy 可能很好,但某一類題型錯誤集中;平均 latency 可能可以接受,但 tail latency 讓產品體驗不穩。

所以這篇要建立的動作很單純:任何統計推論和 ML 建模之前,先把資料型態與摘要看清楚。

來源使用方式

  • 官方考古題 PDF 只用來確認年份、科目名稱與題面,不把兩年題型當成完整範圍。
  • grad-exam-prep 備考頁用來對齊學習路線、題型入口與練習節奏,不視為官方標準答案。
  • OpenIntro、OpenStax 與其他開放教材用來核對公式、定義、假設與常見推導。
  • Stanford CS109 與 scikit-learn 文件用來補 ML/AI 對接:模型訓練、評估、實驗與不確定性報告。

題型辨識提示

  • 類別資料先想次數、比例、列聯表。
  • 數值資料先看平均、中位數、變異、四分位與極端值。
  • 有時間順序的資料,不要任意打散。
  • train/test 分布差很多時,先回描述統計,不要急著調模型。

常見錯誤

  • 看到數字就只算平均。
  • 把二元類別編成 0/1 後,忘了平均值其實是在講比例。
  • 沒檢查離群值,就直接套常態近似或 t-test。
  • 只看整體模型分數,沒有看 label imbalance 和 subgroup error。

練習題

  1. 將年齡、科系、是否錄取、考試分數、每週登入次數分成類別、順序、數值、計數或時間資料。
  2. 用資料 2, 3, 3, 7, 10 算平均數、中位數、range 與樣本變異數,並說明哪個摘要最容易受 10 影響。
  3. 設計一張 ML dataset summary,至少包含 feature type、missing rate、label proportion、train/test distribution。
  4. 找一個模型評估表,寫下你還想補看的三個描述統計。

下一篇怎麼接

資料型態看清楚後,下一步才是機率。第 4 篇會處理事件、條件機率、獨立和 Bayes,讓你知道分類器的 precision、recall 和 base rate 為什麼常被讀錯。

章節級參考對照

  • OpenIntro / OpenStax:支撐資料型態、中心位置、離散程度、比例、列聯表與基礎圖表。
  • scikit-learn:支撐 feature inspection、資料前處理與模型評估語境。
  • Stanford CS109:支撐資料摘要、資料品質與 ML pipeline 的檢查順序。

參考資料