Deep Research 全景圖:80+ 實作的分類、路線與取捨
整個 Deep Research 領域有 80+ 實作,但核心結構只有三階段路線 × 四個組件 × 三種優化方法。這篇用一篇看懂全景:從 Agentic Search 到 Full-stack AI Scientist,從 query planning 到 answer generation,從 workflow prompting 到 end-to-end RL。
Deep Research 前沿 系列文章
整個 Deep Research 領域有 80+ 實作,但核心結構只有三階段路線 × 四個組件 × 三種優化方法。這篇用一篇看懂全景:從 Agentic Search 到 Full-stack AI Scientist,從 query planning 到 answer generation,從 workflow prompting 到 end-to-end RL。
兩篇 NeurIPS 2025 論文回答同一個問題:怎麼從零訓練一個能自主研究網頁的 agent?WebThinker 選擇「給既有用戶模型加上網頁探索能力」,WebDancer 選擇「從資料構造到 RL 訓練完整重來」。兩種哲學,四個階段,一個核心洞察:訓練比 prompt 好。
長時間研究時,agent 面臨「上下文窒息」:資訊堆積、噪音增加、注意力被稀釋。IterResearch 用馬可夫狀態重建解決這個問題,AREX 用內外雙循環實現遞迴自我改進。兩者回答同一個問題:agent 怎麼在數百輪搜尋後依然保持清晰?
前面看的是怎麼訓練 agent 和怎麼維持長時程。這篇看更深一層的問題:怎麼讓 agent 的『規劃』本身變好?WebWeaver 用雙 agent(規劃者+寫作者)從架構上解決,DeepPlanner 用優勢 shaping 從訓練上解決。兩者指向同一件事:規劃是 deep research 的上限。
前四篇分別看全景、訓練、長時程、規劃。這篇看一個把所有環節串起來的完整系統:Tongyi DeepResearch。核心創新是『Agentic CPT』——在預訓練和微調之間插入一個 agentic 中間訓練階段,讓模型天生帶有 agent 偏置。MoE 架構 30B 參數只激活 3B,HLE 32.9 超越 OpenAI o3。
前面看的是怎麼訓練 agent。但訓練需要高品質數據——而 deep research 的訓練數據長期短缺。WebShaper 用數學形式化解決這個問題:把資訊搜尋任務形式化為集合論,再用 agentic Expander 逐步擴展。S1-DeepResearch 則是把訓練從『搜尋為中心』擴展到『真正做研究』。
Deep research agent 跑出來的報告,該怎麼評分?用 LLM 當評審有偏,問人類太貴,測基準又跟不上。STC 等新方法試圖從「自信度」切入解決這個根本問題——但還沒有完美的答案。
DeepResearch Bench II 用 9,430 個專家 rubric 覆蓋 132 個任務,發現最強的 agent 也只滿足不到 50% 的標準。這篇拆解基準架構、评分方法、領先者,並分析整個 deep research 評估格局。
前面看的是怎麼評估。這篇看另一個維度:在推理過程中怎麼動態分配計算資源。BrowseConf 的核心洞察是——agent 自己說的『自信度』就能預測答案準不準。高自信就用少點資源,低自信就多搜幾輪。
所有的 deep research agent 都是『文字為主』的——但真實世界不只有文字。WebWatcher(NeurIPS 2025)是第一個將視覺推理整合進 deep research 的系統,用 OCR、圖像搜尋、代碼執行等工具處理圖表、截圖、視訊等多元資訊。
Deep research 的開源生態已經從『單一框架』演變成『工具叢集』。這篇比較 12+ 個專案:GPT-Researcher 重視多代理協作、STORM 模擬專家對話、smolagents 強調狀態管理。每個工具解決不同問題。
2026 年的 deep research 商用市場已經分化:OpenAI 全面、Perplexity 速度快、Gemini 生態整合、Claude 推理深、Grok 實時性強。這篇比較各家產品的差異——不是誰最好,而是誰最適合你的場景。
這是專案自己的 deep-research skill 設計全公開。核心選擇:只用 Groundlane MCP 做為網頁工具、嚴格的來源品質分級(A/B/C/D)、研究完交 post skill 發文。不是最強的,但是最適合我們的。
10+ 個社群開源的 deep-research skill 代表了 10+ 種「怎麼做研究」的哲學。從 hyperresearch 的持久化 vault 到 jamoeight v2 的 Co-Scientist 6-agent,從對抗驗證到 benchmark 對齊。這篇把它們放在一張表裡看。
Deep research 從『幫你搜資料』到『幫你做研究』已經發生了。但下一步更大:agent 自我進化、群叢協作、科學自動化。這篇看三個方向,以及一個 uncomfortable 的現實:Gartner 預測 40% 的 agent 專案會在 2027 年前被取消。