Skip to content

Metrics & Analytics 面試攻略:從北極星指標到實驗設計

2026年8月20日 1 分鐘
TL;DR Metrics 面試考的是你能不能用數字做決策,而不是你懂多少統計。核心能力:北極星指標的選擇邏輯(為什麼選這個不選那個)、指標樹拆解(找到可操作的 lever)、漏斗分析(哪一步流失最值得修)、A/B testing 的設計與陷阱、以及面對反直覺數據時的判斷力。
目錄
  1. Metrics 面試怎麼考
  2. 北極星指標:為什麼 DAU 不是萬能的
  3. 指標樹:從北極星展開到可操作的 lever
  4. 漏斗分析:面試中的快速版
  5. A/B Testing:設計、陷阱與面試怎麼答
  6. 數據解讀:反直覺結果怎麼處理
  7. 面試技巧
  8. 面試模擬題
    1. 題目
    2. 拆解思路
    3. 範例回答(面試時可以這樣講)
    4. 自我核對清單
  9. 參考資料

Metrics 面試怎麼考

Metrics 環節通常出現在大廠 PM 面試的 Execution round,也會穿插在 Product Sense 和 Strategy 的追問裡。典型的出題方式有三種:

指標設計題:「你會用什麼指標衡量 Instagram Reels 的成功?」——考的是你能不能從商業目標推導出一組互不矛盾的指標,而不是隨口報一個 DAU。

數據診斷題:「YouTube 的觀看時間這週掉了 10%,你會怎麼調查?」——考的是你拆問題的結構和排除假設的順序,不是你會不會寫 SQL。

實驗設計題:「你要怎麼驗證這個新功能有效?」——考的是你對 A/B testing 的理解深度,包括 sample size、實驗期間、以及結果該怎麼解讀。

三種題型的共同點:面試官不在乎你算不算得出確切數字,他們在乎的是你思考的結構和你做取捨時的邏輯。

北極星指標:為什麼 DAU 不是萬能的

北極星指標(North Star Metric)是整個產品團隊對齊的單一指標。它的作用不是「衡量一切」,而是「當團隊意見不合時,用來做最終裁決」。

選北極星指標的三個標準:

  1. 反映使用者價值,不只反映流量。 DAU 告訴你有多少人打開了 app,但沒告訴你他們有沒有得到價值。Spotify 用「每週聽歌時長」而不是 DAU,因為一個人打開 app 但一首歌都沒播,對 Spotify 沒有意義。

  2. 可被團隊行動影響。 營收是重要指標,但大多數功能團隊無法直接影響它。如果你的北極星是「月營收」,團隊每天的工作和這個數字之間隔了太多層。選一個離團隊行動更近的指標——比如「付費轉換率」或「訂閱續約率」。

  3. 領先指標優先於落後指標。 使用者流失率是落後指標——等你看到的時候,人已經走了。「7 日留存率」或「首週完成核心動作的比例」是領先指標,能讓你在問題惡化前介入。

面試時常見的陷阱是直接說「我會用 DAU」。DAU 幾乎永遠不是最好的北極星,因為它不區分高價值使用者和路過的人。當面試官問你「為什麼不用 DAU?」,你要能說出具體的替代方案和理由。

指標樹:從北極星展開到可操作的 lever

北極星指標本身太抽象,無法直接指導日常決策。指標樹的作用是把它層層展開,直到每個葉子節點都是一個團隊可以直接操作的 lever。

以電商產品為例,北極星是「月 GMV(總交易額)」:

月 GMV
├── 訪客數 × 轉換率 × 客單價
│   ├── 訪客數
│   │   ├── 自然流量(SEO、口碑)
│   │   └── 付費流量(廣告、聯盟)
│   ├── 轉換率
│   │   ├── 瀏覽 → 加入購物車(商品頁體驗)
│   │   ├── 購物車 → 結帳(checkout 流程)
│   │   └── 結帳 → 完成付款(支付成功率)
│   └── 客單價
│       ├── 商品均價
│       └── 每單商品數(cross-sell 效果)

面試時畫這棵樹的重點不是畫得多完整,而是:

  • 選對展開維度。 用乘法展開(訪客 × 轉換率 × 客單價)比用加法展開(A 類別 + B 類別 + C 類別)更有結構感。
  • 標出最大的 lever。 畫完樹之後,面試官一定會問「你會先優化哪個?」。回答的依據是:哪個節點的改善空間最大、改善成本最低。如果轉換率只有 1% 而同業平均是 3%,那就先打轉換率。
  • 指出反指標。 每個你要優化的指標,都要配一個你同時監控的反指標。推高轉換率的時候,監控退貨率;推高客單價的時候,監控復購率。這能展示你有系統思維。

漏斗分析:面試中的快速版

漏斗分析是 Metrics 面試的基礎工具。面試時不需要寫 SQL,但你要能在白板上快速畫出一個漏斗、標出每一步的轉換率、然後找到最值得改善的環節。

以 SaaS 產品的使用者啟用漏斗為例:

步驟人數轉換率累計轉換率
造訪首頁10,000100%
註冊3,00030%30%
完成 onboarding1,20040%12%
使用核心功能60050%6%
7 日留存30050%3%

面試官問「你會先改善哪一步?」時,不要只看轉換率最低的那一步。你要考慮:

  • 絕對數量的影響。 註冊轉換率從 30% 提高到 35%,增加 500 個使用者。核心功能使用率從 50% 提高到 55%,只增加 60 個使用者。
  • 改善的可行性。 首頁到註冊的轉換率可能受限於流量品質(你改不了廣告團隊的投放策略),但 onboarding 到核心功能的轉換率完全在你控制範圍內。
  • 對下游的連鎖效應。 漏斗上游的改善會放大下游所有步驟的絕對數量。

A/B Testing:設計、陷阱與面試怎麼答

面試中的 A/B testing 題不是在考你會不會算 p-value。它考的是你對實驗流程的判斷力。

設計一個實驗要回答四個問題:

  1. 假設是什麼? 「我們認為簡化 checkout 流程可以提高轉換率」——假設要具體到可以被否證。
  2. 主要指標是什麼? 只選一個主要指標做決策依據。同時追蹤 2-3 個次要指標和 1 個反指標。
  3. 需要多大的樣本量? 面試時不需要算出精確數字,但你要知道影響 sample size 的因素:baseline 轉換率、你想偵測的最小效果(MDE)、顯著水準和統計檢定力。效果越小,需要的樣本越大。
  4. 跑多久? 至少跑滿一個完整的業務週期(通常一週),確保覆蓋到平日和週末的行為差異。

三個常見陷阱:

  • Novelty effect:新功能上線初期,使用者因為好奇會多用,導致短期指標虛高。解法是把實驗跑得夠長(至少兩週),或只看第二週的數據。
  • Simpson's paradox:整體結果顯示 B 版本贏,但拆分到每個使用者群後,A 版本在每個子群都贏。通常是因為流量分配不均。面試時提到這個會很加分——它展示你知道「看總數不夠,要看分群」。
  • Peeking problem:實驗還沒跑完就看結果、然後在看到顯著時停下來。這會大幅膨脹假陽性率。解法是預先定好實驗結束日期,或用 sequential testing 方法。

數據解讀:反直覺結果怎麼處理

面試官最愛出的追問是:「實驗結果顯示新版本的轉換率提高了 5%,但營收沒變。你怎麼解釋?」

處理反直覺數據的框架:

  1. 先檢查數據品質。 有沒有 logging bug?有沒有 bot 流量被計入?sample 有沒有被汙染(一個使用者同時看到 A 和 B 版本)?
  2. 拆分看。 按使用者群(新使用者 vs 老使用者)、平台(iOS vs Android)、地區拆開看,可能整體平均掩蓋了分群間的差異。
  3. 找因果鏈。 轉換率提高但營收沒變,可能是因為轉換率的提升來自低客單價使用者。或者新版本吸引了更多「嘗試型」使用者,他們轉換了但買的東西便宜。
  4. 判斷是否 ship。 不是所有統計顯著的結果都值得上線。如果效果太小(比如轉換率提高 0.1%),上線的工程成本和長期維護成本可能不值得。

面試時說出「我會先排除數據品質問題,然後拆分看分群差異」就已經超過大多數候選人了。

面試技巧

  • 先問清楚產品是什麼階段。 初創期的北極星可能是啟用率;成長期可能是留存;成熟期可能是 ARPU。階段不同,整套指標邏輯都不同。
  • 永遠配一個反指標。 每次你說「我要提高 X」,馬上接「同時監控 Y 確保不退化」。
  • 用具體數字讓回答有重量。 不要說「轉換率會提高」,說「我預期轉換率從 3% 提高到 3.5%,基於同業 benchmark 和我們目前的 UX friction」。
  • 承認不確定性。 「這個假設需要跑兩週的 A/B test 才能驗證,目前是我基於使用者訪談的推測」——這比假裝確定更有說服力。

面試模擬題

題目

「你負責的 SaaS 產品這個月的付費轉換率從 5% 掉到 3%,你會怎麼調查?」

來源:Google PM Execution Round 難度:中等 環節:execution round

拆解思路

  1. 先釐清問題:這是突然掉的還是逐漸下降?是所有使用者群都掉了還是特定的?有沒有同時期做了什麼改動(定價、UI、行銷活動結束)?
  2. 建立框架:用漏斗拆解——哪一步的轉換率掉了?是「試用→付費」掉了,還是「註冊→試用」掉了導致進入付費漏斗的使用者品質改變?
  3. 深入核心:按維度分群拆——新使用者 vs 老使用者、管道來源、平台、地區。找到「是誰掉了」比「掉了多少」更重要。
  4. 收尾:根據診斷結果提出 2-3 個假設,說明你會用什麼實驗來驗證,以及需要多久。

範例回答(面試時可以這樣講)

排除與分群。 第一步我會先排除數據問題——確認 logging 沒有 bug、有沒有 bot 流量被計入、定義有沒有被改過。確認資料可靠之後,我會按時間軸看——是某一天突然掉的(可能是 bug 或事件),還是過去四週逐漸下降的(可能是結構性問題)。然後按三個維度拆分:用戶來源(Google Ads 用戶 vs 自然流量)、平台(iOS vs Android vs Web)、用戶類型(個人用戶 vs 團隊用戶)。

假設建立。 假設我發現掉最多的是 Google Ads 來源的新用戶,那最可能的原因是廣告團隊最近改了投放策略,帶進了更多「看看就走」的低意向用戶。這種情況下「轉換率下降」不是產品問題,而是流量品質問題——解法是跟行銷團隊確認投放改動,看 CPA 和 LTV 的關係有沒有同步惡化。第二個假設是:如果所有管道都在掉,而且掉的是「試用 14 天→付費」這一步,那可能是最近的產品改動影響了 aha moment 的觸達率——我會去看 onboarding 完成率和核心功能使用率有沒有同步下降。

行動計畫。 無論是哪個假設,我會在兩天內做完分群分析並確定主因。如果是流量品質,短期調整投放目標、長期建立 lead scoring 模型過濾低品質流量。如果是產品問題,先回滾最近的改動觀察恢復情況,再設計 A/B test 驗證改進方案。我會設一個每週追蹤的 dashboard,直到轉換率回到 4.5% 以上。

自我核對清單

核對項目有提到?
先排除資料品質問題(logging/bot/定義)
時間軸分析(突然掉 vs 逐漸下降)
多維度分群(來源、平台、使用者類型)
區分產品問題 vs 流量問題
提出具體假設和對應的驗證方式
加分:設定恢復目標和追蹤機制

參考資料