測試時擴展:BrowseConf 與自信度引導的推理
前面看的是怎麼評估。這篇看另一個維度:在推理過程中怎麼動態分配計算資源。BrowseConf 的核心洞察是——agent 自己說的『自信度』就能預測答案準不準。高自信就用少點資源,低自信就多搜幾輪。
前面看的是怎麼評估。這篇看另一個維度:在推理過程中怎麼動態分配計算資源。BrowseConf 的核心洞察是——agent 自己說的『自信度』就能預測答案準不準。高自信就用少點資源,低自信就多搜幾輪。
前面看的是怎麼訓練 agent 和怎麼維持長時程。這篇看更深一層的問題:怎麼讓 agent 的『規劃』本身變好?WebWeaver 用雙 agent(規劃者+寫作者)從架構上解決,DeepPlanner 用優勢 shaping 從訓練上解決。兩者指向同一件事:規劃是 deep research 的上限。