Skip to content
所有標籤

#evaluation

40 篇文章

CS2881R L7:能力怎麼量,安全門檻怎麼設

Harvard CS 2881R Fall 2025 第 7 講請 METR 的 Joel Becker 處理一個謎:基準測試上,AI 能以一半機率完成人類要花幾小時的任務,而且這個長度每七個月翻倍;但在 METR 自己的隨機對照試驗裡,資深開源開發者用 AI 反而慢了 19%,勞動市場的衝擊也只集中在年輕人。Becker 列出幾種和解方式,核心是基準測試的任務太乾淨、評分太便宜、基準線人員太缺脈絡。課站原本排的前沿安全框架(OpenAI Preparedness Framework、Anthropic RSP)這堂沒講到,本篇依閱讀清單補上它們怎麼把能力量測變成門檻。

清大 NLP 導讀 10:同一個模型為什麼會講得呆板或胡言亂語——解碼策略與 NLG 評估

清大高宏宇 NLP(Fall 2025)解碼與評估單元導讀。前半講模型每一步吐出機率分布之後怎麼選字:greedy 一步錯就回不去,beam search 同時保留幾條候選但偏好短句,top-k/top-p 用抽樣換多樣性(投影片沒寫,教授在課堂口頭補)。後半講怎麼替生成的文字打分:BLEU 的 modified precision 與 brevity penalty、ROUGE-N 與 ROUGE-L、perplexity,以及 GLUE、SQuAD 2.0、MTEB、MMLU 這些 benchmark 各自在量什麼。

CMU 11-768 導讀 A2:替資料視覺化 agent 寫評分器——四類錯誤、MCC 與 Harbor 驗證器

11-768 的 Assignment 2 要學生只用一個固定的 Qwen3-VL-30B-A3B 當裁判,替資料視覺化 agent 的每一次執行判四類錯誤,並用四類 MCC 的平均在私有測試集上評分(占作業 30%);後半還要把自己出的題包成 Harbor 任務,寫一個被驗證器擋下、一個騙過驗證器的錯誤解。它的主題是:評分器就是之後 RL 的 reward。

CMU 11-768 導讀 L10:Deep Research Agent 怎麼評、怎麼訓、怎麼檢索

Akari Asai 的 L10 把 deep research agent 拆成三塊:評測要補齊搜尋難度、領域專業、長答案品質與引用支持四個缺口;訓練走 mid-training → SFT → RL,長答案用 DR Tulu 的演化式 rubric 當 reward;檢索要讓 retriever 看到 agent 的推理,AgentIR-4B 在 BrowseComp-Plus 搭 Tongyi-DR 拿到 68%。

CS224U 行為評估:分析考量、對抗測試、ANLI 與 DynaSent

CS224U 第四單元先問一個問題:行為測試能證明什麼、不能證明什麼。答案是它永遠給不了保證,而且失敗時要先分清是模型的問題還是資料的問題——BERT 在否定句 NLI 上 2.2% 的準確率,用少量例子微調後就回到 90%。接著看 SQuAD 的干擾句、Breaking NLI、ANLI 的人機對抗收集,最後以 DynaSent 兩輪資料收尾。

CS224U 方法與指標 II:資料集、資料切分與模型比較

CS224U「NLP methods and metrics」單元的後半段不談指標公式,談實驗怎麼站得住:資料集要自然還是眾包、要對抗還是常見案例,課程答案都是「兩者都要」;切分要鎖住 test set;baseline 要在定假設時就決定;兩個模型的差異要用信賴區間、Wilcoxon 或 McNemar 檢驗,而且要跑多個隨機初始化。整單元的公開材料齊全(投影片、三支影片、兩份 notebook),但 Kawin Ethayarajh 那場「Real-world NLP assessments」客座沒有公開投影片或影片。

CS224U 開場:同一個問題問了四十年,2023 年的 NLU 課怎麼定義「理解」

CS224U Spring 2023 的第一堂拿「哪些美國州不和任何美國州接壤?」從 1980 年的 Chat-80 一路問到 text-davinci-001,先證明進展是真的,再用 Levesque 的「cheap tricks」、會編造連結的模型和飽和的 benchmark 質疑這些進展算不算理解。課程地圖因此分成兩半:前半教怎麼用 Transformer 與檢索增強的 in-context learning 做系統,後半教怎麼用更難的 benchmark、行為評估與因果解釋方法檢驗系統。

CS224U 方法與指標 I:accuracy 0.81 的分類器、macro F1 只有 0.43——分類指標與生成指標各自編碼了什麼價值

CS224U 投影片用同一張三類別混淆矩陣算出 accuracy 0.81、macro F1 0.43:一個指標說系統很好,另一個說它在兩個小類別上幾乎全錯。這個單元的主張是「不同指標編碼不同價值」,並逐一列出 accuracy、F 分數三種平均、perplexity、word error rate、BLEU 各自的範圍、價值與弱點。期末專案的評分看的也是指標選得對不對,不是分數高不高。

CS189 Spring 2026 Lec 11–12:分類、生成式分類器、logistic regression、ROC

CS189 Spring 2026 Lec 11–12 把分類拆成兩條路:生成式先為每一類建 p(x|y)(GDA:共變異數相同得 LDA、線性邊界,不同得 QDA、二次邊界),判別式直接建 p(y|x)(logistic regression:sigmoid、softmax、交叉熵 MLE,沒有封閉解要靠梯度下降)。兩者的橋是:LDA 的後驗一定能寫成 logistic 形式,反過來不成立。評估方面,準確率在類別不平衡時會騙人,ROC/AUC 掃過所有門檻、不看校準,PR 曲線則在意類別比例。

基準深度解析:DeepResearch Bench II 與評估格局

DeepResearch Bench II 用 9,430 個專家 rubric 覆蓋 132 個任務,發現最強的 agent 也只滿足不到 50% 的標準。這篇拆解基準架構、评分方法、領先者,並分析整個 deep research 評估格局。

評估困境:為什麼 Deep Research 難以被正確評量

Deep research agent 跑出來的報告,該怎麼評分?用 LLM 當評審有偏,問人類太貴,測基準又跟不上。STC 等新方法試圖從「自信度」切入解決這個根本問題——但還沒有完美的答案。

aidebugAsk AI 實戰

Ask AI 明明有課程地圖,為什麼列不完整:Catalog Query 的召回與收斂事故

「有哪些課程文章」第一次觀測被舊快取干擾;真正未命中的 request 已找回四所大學課程地圖,卻因三輪 Writer/Critic 重試花了 51.169 秒。修正 catalog 專用檢索與 review 契約後,一次未命中快取的 production observation 在 26.821 秒內通過 q21。

aiguideAsk AI 實戰

Ask AI Retrieval Eval 怎麼做:Golden Contract、Fixture、Live Run 與證據邊界

Ask AI 把 golden contract、offline fixture、live SSE output 與 production observation 分開保存。fixture 全綠只證明 harness 可重現;public sources 可以量 expected-source recall,不能拿來宣稱看過 hidden ranked chunks 或 model-graded faithfulness。

模型成績單怎麼看:Benchmark、Arena Elo、還有那些數字背後的陷阱

模型發布時貼的 benchmark 數字有三個常見陷阱:只秀贏的(cherry-picking)、訓練資料混入考題(contamination)、大家都考 90 分以上就沒鑑別力(saturation)。最抗操弄的訊號是 Chatbot Arena 的 Elo 排名——真人盲測投票,模型廠商無法控制題目。

跟成熟 coding agent 學設計(12):小模型能寫程式嗎——能力邊界與 eval 紀律

小模型卡的不是『不會想』而是『格式不穩』:tool call JSON、diff hunk 計數、context 預算都會爆。五家參考專案的共識是把評測建立在真實模型行為上(pi 的 model-backed eval、OMP 從真實 session log 校準編輯基準、Codex 甚至為弱模型放寬 parser),looplane 則選最窄但最硬的路:一個 fixture、五次真實 Ollama 執行、manifest 宣告改哪些檔案和哪些 patch 片段才算過,並且把 M2 的失敗原封不動留成證據——不把 mock 當 E2E,不把部分成功講成全過。

跟成熟 coding agent 學設計(5):Verification gate——改了檔案不算成功,驗過才算

五家參考專案裡沒有任何一家在 harness 層強制「宣告的驗證指令全過才算成功」:pi 靠模型自覺、OpenCode 和 Codex 把驗證寫進 system prompt、Claude Code 用獨立的對抗式驗證 subagent 但仍是軟性合約、只有 OMP 的 cleanse 真的由 harness 跑檢查。looplane 選最硬的一條路:改過檔案就必須重跑所有宣告的驗證指令,全過才給 terminal_reason=verified;沒動任何檔案就不重跑(no_changes),把「跑不跑」變成程式碼決定,不是模型決定。

2023 AI 頂會導讀:自然語言處理篇

2023 年是 ChatGPT 之後的第一個完整學術年——NLP 頂會的議程被 LLM 全面重寫:ACL 的 Best Paper 研究幽默理解和政治偏見追蹤,EMNLP 的 Best Paper 用資訊流視角解釋 in-context learning,而 HackAPrompt 這篇 prompt injection 競賽論文直接拿下 EMNLP Best Paper,標誌著安全研究正式進入主流。整年最大的主題轉變是:研究者不再問「怎麼讓模型更準」,開始問「怎麼知道模型在不在騙你」。

techguide

AI 模型評測來源指南——怎麼判斷一個模型好不好用

模型廠商的自測數字不能直接信。這篇整理 2026 年最重要的獨立評測平台、領域 benchmark、市場熱度指標和官方來源,說明各自測什麼、怎麼解讀、偏差在哪,附上不同情境的選型該看哪些數字。

techdeep-dive

Agent Platform 深度解析(七)— Evaluation & Quality Gates:全維度評測、Regression Prevention 與技能發布免疫系統

Evaluation 是 Agent Platform 的「品質免疫系統」:不只是事後統計,而是內建於執行流程的 Pre-run/In-run/Post-run 三階段把關。7 類 Eval 全覆蓋 Flow→Step→Skill→Artifact→Evidence→Policy→Regression。Skill 發布必須通過 Trigger→Functional→Policy→Regression→Human Review 五關,任一失敗即阻擋。Learning Loop 從 Run 捕獲 Signal → 產生 Proposal → Human Review → Sandbox Eval → Quality Gate → Publish,嚴守「Agent 提案、人類審核、Eval 閘門」鐵律。

techdeep-dive

Agent Platform 深度解析(三)— Skill System:版本化能力包、顯式綁定與 Learning Loop 閉環

Skill = 可版本化、可安裝、可審計的能力包。雙檔架構分離 metadata 與指令,顯式綁定替代模型路由,invocation 全記錄。Learning Loop 從 run 產生 signal → proposal → sandbox eval → human review → publish,嚴守「Agent 提案、人類審核、Eval 閘門」原則。

aideep-dive

Arize Phoenix:從 Trace 長出 Dataset、Experiment 與 Evaluator

Phoenix 是 MIT 授權的開源 LLM observability/eval 平台:先用 OpenTelemetry + OpenInference 收 trace,再把 production failure 收進 versioned dataset,以 experiment 比 prompt、model 或 RAG 改動,最後用 code、human 與 LLM evaluator 回寫分數。它不是 Arize AX;自架預設無認證且永久保留資料,正式環境必須先補安全政策。

CMU 07-280 Lecture 13:AI Alignment 從 Reward Hacking 走到可稽核的 AI Scientist

Lecture 13 把 alignment 拆成目標規格、distribution shift、監督與修正能力,並用 autonomous AI scientists 的 benchmark selection、data leakage 與 post-hoc selection 實驗說明:只看最終論文不足以稽核整個研究流程。

CS336 Lecture 9:Scaling law 不是水晶球,是小實驗的外推工具

第九講從資料量與 error 的 log-log 線性關係出發,說明 scaling law 如何比較架構、optimizer、batch 與模型資料配置;Chinchilla 爭議也示範擬合方法、資料範圍與部署目標會改變答案。

aideep-dive

DSPy:用 Signature、Metric 與 Optimizer 編譯 AI 程式

DSPy 不把 prompt 當手寫字串,而以 Signature 宣告任務、Module 決定執行策略,再用資料集與 metric 讓 Optimizer 編譯出較好的提示與示例。

aideep-dive

LangSmith 深入介紹:從 Agent Trace 到離線與線上評估

LangSmith 把 LLM 應用拆成 project、trace、run 與 thread,再用 dataset、evaluator 與 experiment 把 production 問題送回離線回歸測試;它可觀測任何 LLM 應用,不要求使用 LangChain。

私有語料 Retrieval Eval 實測:先把繁中題庫變成可重跑的 benchmark

Repo 已有 20 題繁中/英文 golden dataset,但缺少文件層級 qrels、retrieval run、延遲原始值與執行 script;目前不能誠實報 Recall@k、MRR 或 nDCG 實測分數。本文把缺口整理成可重跑的評估契約。

Berkeley CS288(三):Pre-training、Post-training、Generation 與 Evaluation

08–12 組教材把 base model 變成可互動系統:預訓練決定基礎能力,post-training 改變行為,generation 與 evaluation 決定輸出如何被使用與判讀。

Berkeley CS288(四):Retrieval、RAG 與進階架構如何變成一個系統

13–14 組教材把模型接到外部知識;A3 要學生自行蒐集資料、標註 QA、建索引、做 ablation,並在 CPU 與延遲限制下交付 RAG。

Promptfoo Red Team:把 Prompt Injection、Tool Misuse 與資料外洩變成 Regression Tests

Promptfoo 以 plugins 產風險 probes、strategies 變形攻擊、targets 執行系統、graders 判斷結果;有價值的 red team 必須測整個 agent application,而不只是 foundation model。

Stanford CS224U 導讀:課程網站停在 2023 年春季,但整套教材可以 clone 下來跑

CS224U 的教材不是投影片,是一個 Apache-2.0 的 GitHub repo,講義、作業、評分文件全在裡面。但校內班從 2023 年春季之後連停三個學年,ExploreCourses 一度把它排回 2026-27 春季,2026-09-29 重查時那一節又撤掉了;官方課程描述至今仍列著 relation extraction 與 semantic parsing,2023 年的講次表一堂都沒有。第一份作業的資料載入 cell 在今天的新環境會卡在 Hugging Face 的相容性改動上。

Stanford CS329A 導讀:這門課教自我改進,也親口說了它改進不了什麼

CS329A 的軸心是 generation–verification gap:模型答得出來,卻認不出哪個對。但課程自己下的結論更值得記——目前這些方法讓模型變得更穩定,不是更聰明。錄影公開 9 支,只涵蓋 20 堂中的 9 堂。

RAG 與檢索評估的考點交集:四張證照重複考什麼,還有一張大家以為它考、其實沒有

真正把 RAG 與檢索評估當考點的是四張:AWS AIF-C01(第 2、3 章合計 52%,RAG、向量儲存、FM 評估指標全在裡面)、AWS AIP-C01(第 1 章 31% 裡有 11 個技能點落在向量儲存與 RAG)、NVIDIA NCP-AAI(Knowledge Integration 10% + Evaluation and Tuning 13%)、微軟 AI-500(Develop 30–35% 裡的「多 agent RAG 架構」)。Google PMLE 只貢獻一條 LLM-as-a-judge,而 Claude CCDV-F——那張大家最容易假設它考 RAG 的開發者證照——八個領域裡一條檢索考點都沒有,Eval 只佔 2.6%。附 AIF 與 AIP 的同廠雙級別對照、四家名詞對照表、獨有考點清單與練習專案。

Agents, Prompts, and RAG:一堂課教完之後,剩下的才是難的

BCG 的實驗發現一條「鋸齒狀邊界」:邊界內 AI 大幅提升顧問表現,邊界外 AI 讓結果更差,而人們會在方向盤上睡著。這一講也給了一個很有立場的判斷——盡可能避開 fine-tuning,因為等你調完,下一代模型已經打敗你 fine-tune 過的版本了。

AI Project Strategy:三四個小時的試算表,省掉幾週的錯方向

Andrew Ng 用 deep researcher 當例子示範 error analysis:列是 pipeline 的每個步驟,行是 10 到 100 個查詢,只看表現不好的那些,逐格標記哪裡壞掉。百分比不需要加起來等於 100%。他說這要花三四個小時,但省下的是幾週走錯方向的時間——而真的會去做的人的比例遠低於 100%。

What's Going On Inside My Model?:模型退步了,你先看哪裡

問模型「你心目中的鵝長什麼樣」,它畫出一大群鵝——因為標註資料把一群鵝標成 goose,它以為整群才是那個標籤。這一講給了七種打開 CNN 看內部的方法,然後誠實地說:這套方法到 transformer 上,最前沿的研究也只解釋得了兩層。

上線才是工作的開始:企業 agent 案例橫向讀

Salesforce 從兩萬個部署得到的數字:agent 有 90% 的工作發生在上線之後,跟傳統軟體剛好相反。Stripe 每週合併 1,300 個零人類手寫的 PR,靠的是環境而不是模型。附六家公司的橫向比對。

aideep-dive

調整 agent 之後,怎麼嚴謹比較前後差異:從 golden set 到統計檢定

即使 temperature=0,LLM 輸出實測仍可能抖動 15%。要嚴謹比較 agent 調整前後,得靠凍結 golden set、每題跑 ≥3 次取平均、LLM-as-judge 盲評(pairwise 偏好翻轉率高達 35%)與配對統計檢定,而不是前後各問一遍看感覺。

aiguide

Langfuse 完整指南:LLM 應用的可觀測性從零開始

Langfuse 是目前最成熟的開源 LLM Observability 平台。這篇從 Tracing、Prompt 管理、評估、Dataset 四個核心功能切入,帶你搞清楚它在實際專案中怎麼用。

aiguideRAG 技法大全

RAG 系統模式完整指南:從 Naive 到 Multi-Agent 的十代演化與實戰導航

RAG 已經從簡單的「搜尋+生成」演化成涵蓋十個世代的技術體系,2025 年後更進入 Agentic/Reasoning RAG 新階段。本文是系統化導航:從 Naive RAG 到 Multi-Agent/LongRAG 的十代演化、後十代 Agentic Era(Search-R1/RL 搜索、MCP 協議、GraphRAG 3.x、視覺直嵌)、檢索策略、Chunking、Embedding、Reranking、評估框架、可觀測性、成本優化。每個主題都有對應專文深入。

aiguideRAG 技法大全

RAG 評估框架與工具選型:Promptfoo、RAGAS、DeepEval、TruLens

RAG 評估沒有指定工具的業界標準;先把 retrieval、generation、operation 分開量,再依技術棧選 Promptfoo、RAGAS、DeepEval 或 TruLens。