AI Agent Arxiv Digest — 2026-08-10
Evo-Bench 評測九款模型自主改進鷹架的能力,GPT-5.6 Sol 拿下 +16.6 分但 Office 任務幾乎不動;MEGA 用三層 Wisdom Graph 讓 Agent 優化基礎設施自我進化,知識積累與優化合為同一過程;SHE 把鷹架拆成四個可演化元件,從失敗軌跡學習安全邊界,ASR 降低 3.1 倍且跨模型可遷移
Evo-Bench 評測九款模型自主改進鷹架的能力,GPT-5.6 Sol 拿下 +16.6 分但 Office 任務幾乎不動;MEGA 用三層 Wisdom Graph 讓 Agent 優化基礎設施自我進化,知識積累與優化合為同一過程;SHE 把鷹架拆成四個可演化元件,從失敗軌跡學習安全邊界,ASR 降低 3.1 倍且跨模型可遷移