Skip to content
所有標籤

#metrics

13 篇文章

清大 NLP 導讀 10:同一個模型為什麼會講得呆板或胡言亂語——解碼策略與 NLG 評估

清大高宏宇 NLP(Fall 2025)解碼與評估單元導讀。前半講模型每一步吐出機率分布之後怎麼選字:greedy 一步錯就回不去,beam search 同時保留幾條候選但偏好短句,top-k/top-p 用抽樣換多樣性(投影片沒寫,教授在課堂口頭補)。後半講怎麼替生成的文字打分:BLEU 的 modified precision 與 brevity penalty、ROUGE-N 與 ROUGE-L、perplexity,以及 GLUE、SQuAD 2.0、MTEB、MMLU 這些 benchmark 各自在量什麼。

CS224U 方法與指標 I:accuracy 0.81 的分類器、macro F1 只有 0.43——分類指標與生成指標各自編碼了什麼價值

CS224U 投影片用同一張三類別混淆矩陣算出 accuracy 0.81、macro F1 0.43:一個指標說系統很好,另一個說它在兩個小類別上幾乎全錯。這個單元的主張是「不同指標編碼不同價值」,並逐一列出 accuracy、F 分數三種平均、perplexity、word error rate、BLEU 各自的範圍、價值與弱點。期末專案的評分看的也是指標選得對不對,不是分數高不高。

Product Builder 面試日練 — 2026-09-29:Metrics & Analytics

Metrics & Analytics 面試最容易翻車的地方,不是算不出數字,而是拿到一個看似合理的指標就直接開始優化,沒有先問『這個指標漲了,對業務一定是好事嗎?』。今天練一道指標評估題:『Netflix 想提高使用者的平均單次觀看時長,這是正確的指標嗎?』答案框架用指標樹:先定義北極星指標、拆出驅動指標與護欄指標,再判斷單一指標的漲跌背後可能有好壞兩種成因。案例是 Netflix 自己——2026 年 Q2 股東信裡承認『engagement 不只是觀看時數的量,還包含內容的品質與多樣性』,並把行之兩年半的半年度觀看時數報告改成一年一次,等於公開示範了『指標漲了不代表故事漲了』這件事。

Product Builder 面試日練 — 2026-09-22:Metrics & Analytics

Metrics 面試最常見的陷阱,是把「哪個指標漲了」直接當成「這個決策是對的」,卻沒有先分清楚北極星指標、驅動指標跟護欄指標分別在保護什麼。今天練一道情境題:A/B 測試顯示新結帳流程讓營收上升,但客戶滿意度分數下降,面試官問「你會怎麼決策」。答案框架是先用指標樹釐清北極星、驅動、護欄三層指標的角色,再深挖滿意度下降背後的機制(是不是退貨率、投訴率也一起變差),而不是只看一個指標的漲跌就拍板。案例是 Netflix 前 CPO Neil Hunt 帶隊做封面圖 A/B 測試時,選定「90 秒內抓住使用者注意力」當唯一北極星指標——光是幫電影《The Short Game》換一張小孩打高爾夫球的封面圖,點擊轉換率就漲了 14%,而公司刻意不讓單集熱度、總體觀看時數這些次要指標搶走最終決策權。

Product Builder 面試日練 — 2026-09-15:Metrics & Analytics

Metrics 題裡最容易漏分的不是『你講不出可能的原因』,是講原因講到一半就開始猜,沒有系統性地把可能性排除乾淨。今天用 Google PM 面試官自己公開的根因排查六維度——production bug、UI/UX 改動、rollout 問題、使用者行為轉移、季節性、外部因素——練一道 Google PM 面試真題『YouTube 留言互動在過去 24 小時內下滑,你的下一步是什麼』,搭配 AARRR 先定位這個指標在漏斗的哪一段。案例是 Airbnb 在 S-1 公開說明為什麼北極星指標是『訂房晚數』而不是訪客數或房源數——因為訂房晚數沒辦法靠灌水的方式做假,一動就代表房客跟房東真的都得到了價值。

AI-Native SDLC Playbook L13:用監控閉環讓 SDLC 自己轉起來

Stage 6 是整個 AI-Native SDLC 的收尾也是起點:監控腳本偵測異常 → Claude 自動寫診斷報告為 intent.md → 走完整個開發流程。人從「發起工作」變成「分類和審查工作」。

Product Builder 面試日練 — 2026-09-08:Metrics & Analytics

Metrics 題最容易失手的地方不是講不出指標,是講出一個聽起來合理、卻沒辦法回答『這個指標漲了代表什麼』的名詞。今天用 Lenny Rachitsky 整理的六類北極星指標框架收斂候選範圍,再疊一層指標樹把北極星拆成 output/input/guardrail,練 Meta PM analytical thinking round 常出現的『幫 Instagram Reels 定義北極星指標,並說明如果資源傾向 Reels、犧牲 Stories 會有什麼取捨』。案例是 Netflix 從 DVD 準時到貨率換到串流 15 分鐘觀看率、再換到每月觀看時數中位數的三次北極星指標轉向,示範指標怎麼跟著策略走。

Product Builder 面試日練 — 2026-09-01:Metrics & Analytics

Metrics 題最容易垮的地方不是選不出指標,是說不出「這個指標為什麼能代表使用者價值」,以及分不清相關與因果。Exponent 最新彙整的 2026 真題庫裡有一道 Meta 風格的執行題:留言數上升但觀看時長下降,怎麼辦。今天用指標樹拆解這題,案例是 Facebook 著名的「7 天內加 7 位好友」北極星指標——它幫 Facebook 找到成長槓桿,也一度讓整個矽谷把相關性誤當因果,是講「怎麼驗證指標背後因果關係」的最佳素材。

Cloudflare Observability 怎麼用:Workers Logs、Traces 與 Analytics Engine 的分工

Workers Observability 負責 debug 和 request tracing;Workers Analytics Engine 負責高基數產品事件與自訂 metrics;GraphQL Analytics API 則查 Cloudflare 既有產品資料。把三者分清楚,才不會把 log 當資料庫,也不會把 billing、monitoring、產品分析混在一起。

Product Builder 面試日練 — 2026-08-25:Metrics & Analytics

分析型面試考的不是你會不會寫 SQL,是你能不能在『DAU 漲、廣告主卻在跑』這種矛盾訊號裡,分清楚哪個指標在說謊。Google 一場真實 debrief 裡,候選人因為把『DAU』當成 News 的北極星指標而被刷掉——committee 要的是能連到商業風險的指標,不是儀表板上最好看的那個數字。今天用指標樹拆一道這樣的題目,案例是 Google Search 那則『改個字體顏色多賺十億美金』的傳說。

Metrics & Analytics 面試攻略:從北極星指標到實驗設計

Metrics 面試考的是你能不能用數字做決策,而不是你懂多少統計。核心能力:北極星指標的選擇邏輯(為什麼選這個不選那個)、指標樹拆解(找到可操作的 lever)、漏斗分析(哪一步流失最值得修)、A/B testing 的設計與陷阱、以及面對反直覺數據時的判斷力。

aiguideRAG 技法大全

RAG A/B 測試:怎麼科學地比較兩個 Pipeline 配置

「加了 Cross-Encoder 之後感覺好多了」不是科學的評估。A/B 測試讓你知道改動是否真的有效,效果多大,在哪類查詢上有效。

aiguideRAG 技法大全

RAG 評估框架與工具選型:Promptfoo、RAGAS、DeepEval、TruLens

RAG 評估沒有指定工具的業界標準;先把 retrieval、generation、operation 分開量,再依技術棧選 Promptfoo、RAGAS、DeepEval 或 TruLens。