版本說明:本文依據 Harvard CS 2881R AI Safety Fall 2025 課站的 11 月 20 日講次,以及第 12 講錄影(YouTube 標題「Lecture 12: AI in 2035 and GDPval」,約 1 小時 47 分,2026 年 1 月上傳)。事實皆於 2026-09-30 打開官方材料核對;錄影內容依 YouTube 自動字幕整理。本講材料:課站只有客座名單、錄影連結與一行「Discussion of future directions in AI safety research」,Resources 寫「Resources to be determined」,沒有投影片。講者在課堂上提到的論文與部落格,本文只在確定是哪一篇時才附連結。錄影在課堂休息後直接接到 Kevin Liu 的段落,學生實驗沒有收錄。整門課的存取分級見系列總覽。
系列位置:上一篇 L11:聊天機器人、情感依賴與心理健康|下一篇 期末專題與課程回顧|系列總覽
L9 看的是 AI 對勞動市場已經留下的痕跡,L11 看的是一個意料之外的失敗模式。最後一講把時間軸拉到十年後。三位講者都在 OpenAI 工作,Boaz 介紹客座時說,他沒有粉絲到覺得 OpenAI 什麼都做得最好,但認為 OpenAI 的前沿評測團隊是業界最好的。讀這一講時,這個立場值得記在心上,課站首頁也寫明了 Boaz 的利益揭露。
這一講的結構
| 段落 | 講者 | 錄影時間 |
|---|---|---|
| AI 的未來與他的擔憂 | Boaz Barak | 0:00–0:20 |
| GDPval:怎麼量真實工作 | Tejal Patwardhan(Kevin Liu 代講部分結果) | 0:24–1:20 |
| 為什麼研究還沒被自動化、AI for science | Kevin Liu | 1:20–1:42 |
| 上線前評測的開放問題 | Tejal Patwardhan | 1:42–1:45 |
Boaz:指數成長的虛擬勞動力
Boaz 說他的開場取材自自己那篇談 AI 與經濟的部落格文(即 L9 介紹過的 Thoughts by a Non-Economist)。他的心智模型只有一句:把 AI 想成每年向經濟注入數量指數成長的虛擬勞工,而且每年更能幹、更通用;一開始可能不含機器人,但機器人之後也會跟上。
他先引用 METR 任務長度研究的一張圖(課站 L7 的閱讀清單列有這篇):對人類很簡單的任務,模型最後幾乎都能 100% 解掉。但他加了一個大但書:這是非對抗的設定。對抗穩健性還沒解決,簡單任務永遠找得到讓模型失敗的輸入。
他的推論是,二十年內(也許更短),全球勞動力等於增加十倍。上一次全球人口成長十倍,要回推到 1750 年,而工業革命與科學革命之後,全球 GDP、預期壽命、兒童死亡率都大幅改善,連撒哈拉以南非洲也是同一個趨勢,只是落後。他的結論是:AI 若真的讓勞動力增加十倍,整體而言很可能是往好的方向劇變。
他擔心什麼
他說自己比較不擔心經典的「AI 接管、殺光所有人」劇本。他的看法是,我們對模型既不是完全掌控,也不是完全無知,而是在中間,只是離他覺得安心的程度還很遠。他真正擔心的是三件事:
- 變化太快、控制不足。 可能把 100 到 200 年的進展壓進 10 到 20 年,社會、政府、國際關係都沒準備好。他用航空安全比喻:航空事故率花了 50 年才壓下來,而那 50 年裡飛機本身變化不大;AI 則像是一邊改安全、一邊從腳踏車變成飛機。
- 權力集中。 AI 可以增強個人,例如讓小型非營利組織不再被文件淹沒、讓政府更透明;但也可能讓政府監控的規模前所未見。極權政府過去受限於無法替每個公民配一個眼線,現在可能配得起十個。如果政府擁有絕對服從的 AI 勞工,就沒有任何一個會拒絕違憲命令,也沒有任何一個會吹哨。
- 我們與 AI 的私密對話可能被調閱與監控,除非法律改變。
他也順帶表態:環境影響是真的,但常被嚴重誇大;工作取代是問題,但經濟成長會幫上很多忙,美國許多預算爭議在 4% 成長率下會消失。
Patwardhan:GDPval 怎麼量真實工作
Tejal Patwardhan 參與建置 GDPval。她說過去的評測像 MMLU、GPQA 量的是考試題,GDPval 是最早能量「模型能不能做真實工作」的方法之一。
為什麼要量能力,而不是等採用數據? 她的理由是使用量、生產力、GDP 都是落後指標。飛機、鐵路、網際網路從能力存在到普及都花了數年甚至數十年;自駕車也一樣,要人願意坐進去需要時間與文化轉變。評測能在監管與文化跟上之前,先預測模型能做什麼。
任務怎麼來的:
- 先挑占美國 GDP 超過 5% 的產業
- 再挑這些產業裡薪資最高、以數位工作為主的職業,例如編輯、註冊護理師、房地產經紀人、藥師
- 找資歷深的從業者(要通過履歷審查、背景調查等門檻)提供自己在工作上實際做過的成品,去除個資
- 任務跨度從數小時到數週,例如製造工程師設計電纜捲盤架、投行分析師做競爭者估值表
怎麼評分: 另一批專家扮演主管,盲看兩份成品(人類的真實成品與模型的輸出),選出比較想用哪一份,同時考慮正確性與格式、可讀性等主觀面向。每題至少三位專家、每位看至少三個模型樣本,勝率取平均,不是 best-of-3。
她在課堂上報告的結果:
- 縱軸是「勝過或打平產業專家」的比例。GPT-4o 只有約一成左右,o3 與 GPT-5 已明顯接近專家,趨勢大致呈線性
- Claude 在他們的評測裡更接近與專家打平
- OpenAI 的模型在純文字任務較強,Claude 在處理多模態檔案的任務較強
- 提高推理強度會提升表現
- 模擬「先讓模型做,不滿意再自己做」的工作流程:GPT-4 之後每一代都能省時間與成本,GPT-5 約快 1.4 到 1.6 倍
她特別講了失敗的嚴重程度:在 GPT-5 被判輸的樣本裡,專家重新評估後,約 23% 其實認為模型較好(反映專家之間本來就不一致),約一半是「可接受但比人差」,約 27% 是明顯不合格,約 3% 屬於災難性錯誤。她說只要災難率不降,模型就很難在沒有人監督的情況下上線。
模型常錯在哪: Kevin Liu 代講這段時說,很多失敗出在指令遵循與格式,跟智力關係不大:沒交出要求的檔案類型、投影片內容跑出頁面、用了某些字型無法顯示的特殊字元。他們寫了一份列出所有常見問題的詳細提示,再加上 best-of-4,分數就有實質提升。他的解讀是這裡還有大量低垂的果實。
限制,他們自己列的:
- 只有數位工作,職業數量有限
- 任務自成一體、一次交件;不測「在公司待兩年的人,聽一句話就知道要做什麼」這種脈絡能力
- 任務描述非常詳細,因為模型對工作一無所知;Patwardhan 說論文裡有減少脈絡的實驗,表現會下降但幅度不大
- 量的是能明確定義的任務子集,不是整份工作
公開子集與自動評分服務都可以用,Kevin Liu 也提到 OpenAI 的其他評測列在 evals.openai.com。有學生當場抱怨提交後遲遲沒收到結果,Patwardhan 坦承自動評分器「不太好」,正在考慮開源更多評測內容,讓研究者自己評分。
課堂上的「你害怕嗎」
Patwardhan 問學生是否害怕。幾段回應值得記:一位從金融業入門職位回到學校的學生說,就是因為覺得 GDPval 這類任務遲早會追上他的工作;另一位擔心不是每個人都有能力轉型,恐懼本身會限制人;還有學生擔心權力集中,問前沿模型會不會為了控制衝擊而延後發布。Patwardhan 的回應是:勞動力的議價能力來自它的價值,GDPval 的任務正是依美國勞工統計局的職業任務拆解來設計的,如果模型在這些任務上越來越好,勞動力的獨特性可能會降低。
被問到 AGI 是否不可避免時,Boaz 認為除非遇到意料外的技術瓶頸,否則是不可避免的,理由是 bitter lesson:最好的程式模型是用大量與程式無關的資料訓練出來的。Liu 則認為時程可以延後,但要避免整件事,需要在上百萬個「做窄系統還是交給通用系統」的小決定上每次都說不,以社會目前的協調能力很難。
Liu:為什麼 coding agent 還沒自動化 AI 研究
Kevin Liu 先展示 SWE 類 benchmark、Terminal-Bench 與 OpenAI 的 PaperBench(重現 ICML 論文)都在穩定上升,然後問:既然如此,為什麼研究還沒被自動化?他給的理由:
- 研究常卡在算力與等實驗,不是寫程式
- ML 程式的回饋很慢。 軟體工程改完兩分鐘就知道對不對,ML 的 bug 可能要跑一天才知道修好沒
- 驗證非常難。 他舉了兩個例子:一個是 Anthropic 公開的 TPU 相關 bug,修了一個 bug 卻引入另一個只在特定 batch size 與模型設定下出現的編譯器 bug;一個是 OpenAI 排查 Codex 是否變差,最後要靠跨硬體的回歸分析才找到問題。模型在劣化狀態下仍然「能動」,只是差一點,極難察覺
- 要能重現很久以前的 ablation,等於要讓每個版本的 repo 永遠給出同樣結果
- 大型訓練基礎設施很複雜,每次嘗試要兩天時,模型需要 20 次才對、人需要 5 次才對,差別就很痛
他觀察到公司裡有非常有生產力的人幾乎不用 agent,而是用 Vim 一次寫對,因為驗證成本太高。
模型已經很好用的地方,他歸納出幾個特徵:很難做但驗證很快、失敗可以容忍、正確性是模糊的、不需要深度脈絡、需要大量耐力而非腦力。他舉的例子是用 agent 稽核其他模型的不當行為(他提到 Transluce 與 Anthropic 的相關研究),以及 Codex 的 code review:純加法、檢查成本低、偶爾抓到有意思的問題。
他的預測:
- 「vibe-coded」的研究程式碼(資料處理、繪圖、參數掃描)在數量上會占多數,而且都由模型寫;但這不代表 80% 的重要工作被加速
- 現在的世界是為「兩秒 agent」(確定性程式)和「兩年 agent」(待兩年的工程師)設計的,中間的「兩天 agent」很難用;要嘛花大量人工調整工作流程,要嘛等模型的時間跨度變長
- 能力的可預測擴展,不代表影響可預測。真實任務由許多子任務串成,缺一個就卡住,所以實際影響常以階梯式出現
講到 AI for science,他說模型目前擅長文獻回顧、把每塊石頭翻過來,以及定義清楚的中等難度數學。Boaz 補充自己的用法:讓 Codex 處理 LaTeX 與參考文獻、通讀整篇論文標出不清楚的地方,但還沒用在原創研究。他也提醒,把「顯然的步驟」交給模型是雙面刃,重走一遍瑣碎推導有時是學習的一部分,所以他會要新進成員一開始多問人。
最後三分鐘:上線前評測的三個開放問題
Patwardhan 用兩張投影片收尾,建議學生直接去讀任何一份模型的 system card。她列出隨能力成長而變難的三件事:
- 能力誘發:加更多測試時運算、更好的 scaffold 或提示,模型能做的更多,怎麼確保上線前真的測到上限?
- 情境覺察:模型可能察覺自己正在被測試,測試結果因此不代表部署後的行為
- 長時程風險難以在上線前測:例如跨越數月、需要實驗室實作的生物攻擊規劃,時間盒內的評測根本測不到;需要能從短時程評測外推長時程能力的擴展規律
她的結語是這裡還有大量沒有答案的研究問題。
讀這一講要注意什麼
- 三位講者都在 OpenAI。GDPval 的結果、失敗分布與「模型越來越好」的判斷,都是開發方在課堂上的口頭報告;本文的數字依自動字幕整理,引用前請對照原論文
- 課站沒有閱讀清單,Boaz 提到的書評、Liu 引用的部落格,本文沒有附連結
- 比預測本身更值得帶走的,是三種看未來的方法:Boaz 用總體經濟類比,Patwardhan 用任務評測,Liu 用研究工作流程的瓶頸
自學怎麼做
- 先讀 L9 的 Boaz 部落格文段落,再看 Boaz 的開場,他的「虛擬勞動力」就是那篇文章的口語版。
- 看 Patwardhan 的段落時,拿 L9 的學生實驗 對照:學生用模型評分,GDPval 用專家盲評,差在哪裡?
- 看 Liu 的段落時,把他列的「適合交給模型的特徵」套到你自己手上的一件工作。
今晚可以做的一件事:照 Patwardhan 的建議,打開一份你常用模型的 system card,只讀目錄,把每一節歸到她說的三個問題之一。歸不進去的那幾節,就是你還不知道評測團隊在擔心什麼的地方。
延伸閱讀
- 能力量測與 frontier safety framework:L7:能力與安全
- AI 做 AI 研發的時間軸:L6:遞迴自我改進
- 情境覺察與 scheming:L8:Scheming、Reward Hacking 與欺騙
參考資料
- Harvard CS 2881R AI Safety, Fall 2025 課站 — 11 月 20 日講次、客座名單、「Resources to be determined」、利益揭露
- Lecture 12: AI in 2035 and GDPval(錄影) — Boaz 開場、GDPval 介紹與結果、研究自動化瓶頸、上線前評測問題
- Boaz Barak:Thoughts by a Non-Economist on AI and Economics — Boaz 開場引用的部落格文
- Patwardhan et al.:GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks — 講者在課堂上介紹的論文;本文數字依錄影,引用前請對照論文
- PaperBench: Evaluating AI's Ability to Replicate AI Research — Liu 用來說明 AI 研究能力進展的評測
- METR:Measuring AI Ability to Complete Long Tasks — Boaz 開場引用的 METR 研究,列於課站 L7 閱讀清單
- OpenAI evals 網站 — 課堂上提到的 OpenAI 評測彙整頁
Loading...