CMU 10-423 收尾:練習考卷、HW623 論文報告與期末專案——課程怎麼驗收,校外怎麼自我檢核
CMU 10-423 除了四份作業,還用四種方式驗收:6 次課堂小考、2 次程式測驗、1 次綜合考試,以及占 25% 的三人期末專案;10-623/723 另外多一份 HW623 論文報告。校外拿得到的是附解答的練習考卷(13 大題、167 分)、HW623 題目與 33 篇論文清單、12 頁的專案 handout。本篇整理它們的結構與規則,並給出不用看解答也能自我檢核的方法。
CMU 10-423 除了四份作業,還用四種方式驗收:6 次課堂小考、2 次程式測驗、1 次綜合考試,以及占 25% 的三人期末專案;10-623/723 另外多一份 HW623 論文報告。校外拿得到的是附解答的練習考卷(13 大題、167 分)、HW623 題目與 33 篇論文清單、12 頁的專案 handout。本篇整理它們的結構與規則,並給出不用看解答也能自我檢核的方法。
今天的 Paper Reading 輪練是 arXiv:2609.29875《When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression》——2026 年 9 月才掛上 arXiv 的新論文,提出 Interaction Aware Compression for Long Horizon Reasoning(ICLR),一個 training-free、on-line 的方法,用 frozen proxy entropy 排序歷史推理區塊的可丟棄程度,同時保留 actions、tool calls、observations 不動;在 260 個 WorkBuddyBench 任務上,平均 reward 從 0.699 提升到 0.718,同時 input/output/cache read token 分別降低 25.5%/14.4%/33.3%。核心概念涵蓋為什麼刪除歷史推理不像刪靜態 CoT 那麼單純(會改變後續動作)、trajectory amplification 這個非線性效應、『推理何時能被安全遺忘』的判準是有沒有被外部化成 code/file/tool output,以及這篇論文的發現如何跟 Claude Code、Deep Agents 這類業界 harness 的 compaction/offloading 機制相呼應。練習題走審稿人視角,討論怎麼驗證這個方法不是在特定 benchmark 上運氣好,以及要落地到跑數小時的 coding agent 該怎麼決定壓縮時機。
今天的 Paper Reading 輪練是 arXiv:2509.06917《Paper2Agent》——剛在 2026 年登上 Nature 的論文,提出一套自動框架,用多個 specialist agent 分析研究論文與它的開源程式碼,建構出可測試、可迭代精煉的 Model Context Protocol(MCP)伺服器,再接上 Claude Code 這類 chat agent,用自然語言重現論文結果、甚至回答原論文沒問過的新問題;作者用 AlphaGenome、ScanPy、TISSUE 三個案例驗證,並宣稱因此發現了一個跟 ADHD 風險相關的新剪接變異。核心概念涵蓋 specialist + coordinator 的多 agent 分工模式、MCP 作為『論文能力』到『可呼叫工具』的標準化介面、iterative generate-test-refine 迴圈怎麼取代一次性人工驗證、以及『忠實重現原結果』跟『正確回答新查詢』是兩種要分開驗證的可靠性標準。練習題走審稿人視角,討論怎麼設計實驗驗證這類自動生成 agent 不是在幻覺,以及要把這套系統落地成公司內部工具時該加什麼防護。
把論文工作流拆成三個動作——找、讀、寫,各推薦一個工具:Google Scholar 搜論文、Moonlight AI 讀論文、CorTeX 協作寫論文。三個工具免費就能用,合在一起覆蓋從文獻探索到投稿的完整流程。
今天的 Paper Reading 輪練的是 arXiv:2609.11028《BenchShield》——針對 LLM agent 評測基礎設施的 reward hacking 偵測系統,用靜態 taint analysis 抓評測前的可利用路徑,搭配 runtime 證據把『這次跑分沒有作弊』變成可驗證的宣告,在 456 筆人工標註的軌跡上把 full-chain recall 從 23-94% 拉到 77-100%,runtime 偵測準確率達 96%。核心概念涵蓋 reward hacking 為什麼是評測基礎設施(而不只是模型)的問題、taint analysis 怎麼在靜態與動態兩層分工、為什麼『可利用捷徑』不算違規卻仍要防、以及讀論文時該怎麼用實驗設計去反推作者取捨。額外搭配 BAITBENCH 論文跟 Hugging Face agent swarm 真實資安事件,把『reward hacking 不是紙上談兵』的生產環境代價講清楚。
Paper reading 面試環節考的不是背論文結論,而是能不能在 15-20 分鐘內講清楚一篇陌生論文的問題定義、方法核心與限制,並提出有意義的追問。今天精讀的論文提出 invalidation contracts:讓 LLM agent 快取的錯誤修復建議帶上版本戳記與可快取性提示,伺服端資料一旦飄移就能精準逐筆(row-level)讓快取失效,而不必整批作廢或每次都重新推導。論文最核心的洞察是把「快取有沒有省到錢」拆成兩個獨立變數——validity(快取內容還對不對,只跟協議設計有關)與 compliance(規劃模型願不願意採用這個修復建議,因模型而異,同一份資料在 Claude Haiku 4.5 上有 100% 的第一次遵循率,在 Claude Sonnet 5 上卻可能低於 11%)。這個拆解框架本身就是很好的面試素材:它示範了怎麼把一個含糊的效能問題,拆成可以分別度量、分別歸因的兩個因子。
Paper reading round 考的不是你有沒有把論文讀完,而是你能不能在有限時間內抓到核心 claim、講清楚設計選擇背後的 trade-off,並提出可驗證的追問。今天用剛發表的 SparseRead(token 效率讀取層,2026-08-23 掛上 arXiv)當練習素材,拆解 regime-aware Read Gate、Reader Backends、stateful protocol 三個核心機制,並完整跑一輪『事前過濾 vs 事後裁剪』的技術追問。
Paper reading round 考的不是你有沒有把論文讀完,而是你能不能像親自做過這個研究一樣,講出關鍵設計選擇背後的 trade-off、指出實驗設計的漏洞,並預測下一步該怎麼做。今天用剛發表的 OneDayAgent(長程 agent harness,2026-08-04 掛上 arXiv)當練習素材,拆解 task decomposition、context 壓縮、verify-repair 三個核心機制,並完整跑一輪典型的論文追問。
Paper Reading 面試不是考你有沒有讀過那篇 paper,而是考你能不能快速理解一個新方法並找出它的限制。AI-native 公司(Anthropic、OpenAI)特別愛考。準備策略:練習 30 分鐘讀完一篇 paper 並能口述 contribution + limitation,建立自己的必讀論文清單,每篇練習用三句話總結。
arXiv 不做 peer review,約 2% 投稿被拒。判斷品質靠外部訊號:頂會收錄 > 機構 + 開源復現 > 引用品質。附 20 項實戰 checklist 和 2026 年工具箱(PWC 已關閉)。
讀論文是兩個問題疊在一起:方法論(Keshav 三遍閱讀法,5-10 分/1 小時/4-5 小時)決定怎麼讀,工具(arXiv HTML、alphaXiv、NotebookLM、Connected Papers、Zotero)負責縮短每一遍的時間。AI 負責降低理解門檻,判斷對錯永遠留給人。