Skip to content

CS2881R L12:AI 2035 與 GDPval

2026年9月30日1 分鐘
TL;DRHarvard CS 2881R 最後一講由 Boaz Barak 和兩位 OpenAI 客座 Tejal Patwardhan、Kevin Liu 談未來十年。Boaz 的心智模型是:AI 等於每年向經濟注入指數成長、也越來越通用的虛擬勞動力,他最擔心的是變化太快而控制不足,以及權力集中與監控。Patwardhan 介紹 GDPval:用產業專家的真實工作成品當標準答案,由另一批專家盲評。Liu 說明為什麼 coding agent 還沒自動化 AI 研究:驗證太貴、回饋迴圈太長。課站這講的 Resources 寫「to be determined」,本文內容全部來自錄影。

🌏 English version

版本說明:本文依據 Harvard CS 2881R AI Safety Fall 2025 課站的 11 月 20 日講次,以及第 12 講錄影(YouTube 標題「Lecture 12: AI in 2035 and GDPval」,約 1 小時 47 分,2026 年 1 月上傳)。事實皆於 2026-09-30 打開官方材料核對;錄影內容依 YouTube 自動字幕整理。本講材料:課站只有客座名單、錄影連結與一行「Discussion of future directions in AI safety research」,Resources 寫「Resources to be determined」,沒有投影片。講者在課堂上提到的論文與部落格,本文只在確定是哪一篇時才附連結。錄影在課堂休息後直接接到 Kevin Liu 的段落,學生實驗沒有收錄。整門課的存取分級見系列總覽。

系列位置:上一篇 L11:聊天機器人、情感依賴與心理健康|下一篇 期末專題與課程回顧|系列總覽

L9 看的是 AI 對勞動市場已經留下的痕跡,L11 看的是一個意料之外的失敗模式。最後一講把時間軸拉到十年後。三位講者都在 OpenAI 工作,Boaz 介紹客座時說,他沒有粉絲到覺得 OpenAI 什麼都做得最好,但認為 OpenAI 的前沿評測團隊是業界最好的。讀這一講時,這個立場值得記在心上,課站首頁也寫明了 Boaz 的利益揭露。

這一講的結構

段落講者錄影時間
AI 的未來與他的擔憂Boaz Barak0:00–0:20
GDPval:怎麼量真實工作Tejal Patwardhan(Kevin Liu 代講部分結果)0:24–1:20
為什麼研究還沒被自動化、AI for scienceKevin Liu1:20–1:42
上線前評測的開放問題Tejal Patwardhan1:42–1:45

Boaz:指數成長的虛擬勞動力

Boaz 說他的開場取材自自己那篇談 AI 與經濟的部落格文(即 L9 介紹過的 Thoughts by a Non-Economist)。他的心智模型只有一句:把 AI 想成每年向經濟注入數量指數成長的虛擬勞工,而且每年更能幹、更通用;一開始可能不含機器人,但機器人之後也會跟上。

他先引用 METR 任務長度研究的一張圖(課站 L7 的閱讀清單列有這篇):對人類很簡單的任務,模型最後幾乎都能 100% 解掉。但他加了一個大但書:這是非對抗的設定。對抗穩健性還沒解決,簡單任務永遠找得到讓模型失敗的輸入。

他的推論是,二十年內(也許更短),全球勞動力等於增加十倍。上一次全球人口成長十倍,要回推到 1750 年,而工業革命與科學革命之後,全球 GDP、預期壽命、兒童死亡率都大幅改善,連撒哈拉以南非洲也是同一個趨勢,只是落後。他的結論是:AI 若真的讓勞動力增加十倍,整體而言很可能是往好的方向劇變。

他擔心什麼

他說自己比較不擔心經典的「AI 接管、殺光所有人」劇本。他的看法是,我們對模型既不是完全掌控,也不是完全無知,而是在中間,只是離他覺得安心的程度還很遠。他真正擔心的是三件事:

  • 變化太快、控制不足。 可能把 100 到 200 年的進展壓進 10 到 20 年,社會、政府、國際關係都沒準備好。他用航空安全比喻:航空事故率花了 50 年才壓下來,而那 50 年裡飛機本身變化不大;AI 則像是一邊改安全、一邊從腳踏車變成飛機。
  • 權力集中。 AI 可以增強個人,例如讓小型非營利組織不再被文件淹沒、讓政府更透明;但也可能讓政府監控的規模前所未見。極權政府過去受限於無法替每個公民配一個眼線,現在可能配得起十個。如果政府擁有絕對服從的 AI 勞工,就沒有任何一個會拒絕違憲命令,也沒有任何一個會吹哨。
  • 我們與 AI 的私密對話可能被調閱與監控,除非法律改變。

他也順帶表態:環境影響是真的,但常被嚴重誇大;工作取代是問題,但經濟成長會幫上很多忙,美國許多預算爭議在 4% 成長率下會消失。

Patwardhan:GDPval 怎麼量真實工作

Tejal Patwardhan 參與建置 GDPval。她說過去的評測像 MMLU、GPQA 量的是考試題,GDPval 是最早能量「模型能不能做真實工作」的方法之一。

為什麼要量能力,而不是等採用數據? 她的理由是使用量、生產力、GDP 都是落後指標。飛機、鐵路、網際網路從能力存在到普及都花了數年甚至數十年;自駕車也一樣,要人願意坐進去需要時間與文化轉變。評測能在監管與文化跟上之前,先預測模型能做什麼。

任務怎麼來的:

  • 先挑占美國 GDP 超過 5% 的產業
  • 再挑這些產業裡薪資最高、以數位工作為主的職業,例如編輯、註冊護理師、房地產經紀人、藥師
  • 找資歷深的從業者(要通過履歷審查、背景調查等門檻)提供自己在工作上實際做過的成品,去除個資
  • 任務跨度從數小時到數週,例如製造工程師設計電纜捲盤架、投行分析師做競爭者估值表

怎麼評分: 另一批專家扮演主管,盲看兩份成品(人類的真實成品與模型的輸出),選出比較想用哪一份,同時考慮正確性與格式、可讀性等主觀面向。每題至少三位專家、每位看至少三個模型樣本,勝率取平均,不是 best-of-3。

她在課堂上報告的結果:

  • 縱軸是「勝過或打平產業專家」的比例。GPT-4o 只有約一成左右,o3 與 GPT-5 已明顯接近專家,趨勢大致呈線性
  • Claude 在他們的評測裡更接近與專家打平
  • OpenAI 的模型在純文字任務較強,Claude 在處理多模態檔案的任務較強
  • 提高推理強度會提升表現
  • 模擬「先讓模型做,不滿意再自己做」的工作流程:GPT-4 之後每一代都能省時間與成本,GPT-5 約快 1.4 到 1.6 倍

她特別講了失敗的嚴重程度:在 GPT-5 被判輸的樣本裡,專家重新評估後,約 23% 其實認為模型較好(反映專家之間本來就不一致),約一半是「可接受但比人差」,約 27% 是明顯不合格,約 3% 屬於災難性錯誤。她說只要災難率不降,模型就很難在沒有人監督的情況下上線。

模型常錯在哪: Kevin Liu 代講這段時說,很多失敗出在指令遵循與格式,跟智力關係不大:沒交出要求的檔案類型、投影片內容跑出頁面、用了某些字型無法顯示的特殊字元。他們寫了一份列出所有常見問題的詳細提示,再加上 best-of-4,分數就有實質提升。他的解讀是這裡還有大量低垂的果實。

限制,他們自己列的:

  • 只有數位工作,職業數量有限
  • 任務自成一體、一次交件;不測「在公司待兩年的人,聽一句話就知道要做什麼」這種脈絡能力
  • 任務描述非常詳細,因為模型對工作一無所知;Patwardhan 說論文裡有減少脈絡的實驗,表現會下降但幅度不大
  • 量的是能明確定義的任務子集,不是整份工作

公開子集與自動評分服務都可以用,Kevin Liu 也提到 OpenAI 的其他評測列在 evals.openai.com。有學生當場抱怨提交後遲遲沒收到結果,Patwardhan 坦承自動評分器「不太好」,正在考慮開源更多評測內容,讓研究者自己評分。

課堂上的「你害怕嗎」

Patwardhan 問學生是否害怕。幾段回應值得記:一位從金融業入門職位回到學校的學生說,就是因為覺得 GDPval 這類任務遲早會追上他的工作;另一位擔心不是每個人都有能力轉型,恐懼本身會限制人;還有學生擔心權力集中,問前沿模型會不會為了控制衝擊而延後發布。Patwardhan 的回應是:勞動力的議價能力來自它的價值,GDPval 的任務正是依美國勞工統計局的職業任務拆解來設計的,如果模型在這些任務上越來越好,勞動力的獨特性可能會降低。

被問到 AGI 是否不可避免時,Boaz 認為除非遇到意料外的技術瓶頸,否則是不可避免的,理由是 bitter lesson:最好的程式模型是用大量與程式無關的資料訓練出來的。Liu 則認為時程可以延後,但要避免整件事,需要在上百萬個「做窄系統還是交給通用系統」的小決定上每次都說不,以社會目前的協調能力很難。

Liu:為什麼 coding agent 還沒自動化 AI 研究

Kevin Liu 先展示 SWE 類 benchmark、Terminal-Bench 與 OpenAI 的 PaperBench(重現 ICML 論文)都在穩定上升,然後問:既然如此,為什麼研究還沒被自動化?他給的理由:

  • 研究常卡在算力與等實驗,不是寫程式
  • ML 程式的回饋很慢。 軟體工程改完兩分鐘就知道對不對,ML 的 bug 可能要跑一天才知道修好沒
  • 驗證非常難。 他舉了兩個例子:一個是 Anthropic 公開的 TPU 相關 bug,修了一個 bug 卻引入另一個只在特定 batch size 與模型設定下出現的編譯器 bug;一個是 OpenAI 排查 Codex 是否變差,最後要靠跨硬體的回歸分析才找到問題。模型在劣化狀態下仍然「能動」,只是差一點,極難察覺
  • 要能重現很久以前的 ablation,等於要讓每個版本的 repo 永遠給出同樣結果
  • 大型訓練基礎設施很複雜,每次嘗試要兩天時,模型需要 20 次才對、人需要 5 次才對,差別就很痛

他觀察到公司裡有非常有生產力的人幾乎不用 agent,而是用 Vim 一次寫對,因為驗證成本太高。

模型已經很好用的地方,他歸納出幾個特徵:很難做但驗證很快、失敗可以容忍、正確性是模糊的、不需要深度脈絡、需要大量耐力而非腦力。他舉的例子是用 agent 稽核其他模型的不當行為(他提到 Transluce 與 Anthropic 的相關研究),以及 Codex 的 code review:純加法、檢查成本低、偶爾抓到有意思的問題。

他的預測:

  • 「vibe-coded」的研究程式碼(資料處理、繪圖、參數掃描)在數量上會占多數,而且都由模型寫;但這不代表 80% 的重要工作被加速
  • 現在的世界是為「兩秒 agent」(確定性程式)和「兩年 agent」(待兩年的工程師)設計的,中間的「兩天 agent」很難用;要嘛花大量人工調整工作流程,要嘛等模型的時間跨度變長
  • 能力的可預測擴展,不代表影響可預測。真實任務由許多子任務串成,缺一個就卡住,所以實際影響常以階梯式出現

講到 AI for science,他說模型目前擅長文獻回顧、把每塊石頭翻過來,以及定義清楚的中等難度數學。Boaz 補充自己的用法:讓 Codex 處理 LaTeX 與參考文獻、通讀整篇論文標出不清楚的地方,但還沒用在原創研究。他也提醒,把「顯然的步驟」交給模型是雙面刃,重走一遍瑣碎推導有時是學習的一部分,所以他會要新進成員一開始多問人。

最後三分鐘:上線前評測的三個開放問題

Patwardhan 用兩張投影片收尾,建議學生直接去讀任何一份模型的 system card。她列出隨能力成長而變難的三件事:

  1. 能力誘發:加更多測試時運算、更好的 scaffold 或提示,模型能做的更多,怎麼確保上線前真的測到上限?
  2. 情境覺察:模型可能察覺自己正在被測試,測試結果因此不代表部署後的行為
  3. 長時程風險難以在上線前測:例如跨越數月、需要實驗室實作的生物攻擊規劃,時間盒內的評測根本測不到;需要能從短時程評測外推長時程能力的擴展規律

她的結語是這裡還有大量沒有答案的研究問題。

讀這一講要注意什麼

  • 三位講者都在 OpenAI。GDPval 的結果、失敗分布與「模型越來越好」的判斷,都是開發方在課堂上的口頭報告;本文的數字依自動字幕整理,引用前請對照原論文
  • 課站沒有閱讀清單,Boaz 提到的書評、Liu 引用的部落格,本文沒有附連結
  • 比預測本身更值得帶走的,是三種看未來的方法:Boaz 用總體經濟類比,Patwardhan 用任務評測,Liu 用研究工作流程的瓶頸

自學怎麼做

  1. 先讀 L9 的 Boaz 部落格文段落,再看 Boaz 的開場,他的「虛擬勞動力」就是那篇文章的口語版。
  2. 看 Patwardhan 的段落時,拿 L9 的學生實驗 對照:學生用模型評分,GDPval 用專家盲評,差在哪裡?
  3. 看 Liu 的段落時,把他列的「適合交給模型的特徵」套到你自己手上的一件工作。

今晚可以做的一件事:照 Patwardhan 的建議,打開一份你常用模型的 system card,只讀目錄,把每一節歸到她說的三個問題之一。歸不進去的那幾節,就是你還不知道評測團隊在擔心什麼的地方。

延伸閱讀

參考資料