Skip to content
所有標籤

#eval

4 篇文章

Prompt 版本控制:改一個字可能讓 eval 從 5/5 掉到 0/5

Rivumi 的 prompt 已到 `m3-exact-edit-v4`:版本寫進 artifact,core/tool/interaction/runtime/instructions/skills/workspace/memory 以 stable/dynamic section 組裝,並加入 replace_text、unified diff、direct reply 的正反例。unit tests 已釘住結構,live eval 覆蓋仍需擴大。

tech deep-dive

台股研究 Agent 實戰系列(篇 5):評估方法學:walk-forward、run card 與 50% 的誠實 baseline

我不量測『感覺很準』,我用 walk-forward 凍結參數跑 OOS、run card 記錄每次輸入的 hash、golden eval 留下 5/10 = 50% 的誠實 baseline,讓這個 agent 承認自己還不準。

tech deep-dive

台股研究 Agent 實戰系列(篇 6):讓 LLM 報告的每個數字都可稽核

LLM 寫報告時最容易幻覺的不是觀點而是數字,所以我把所有可信數字建成 SHA-256 定址的 evidence manifest,LLM 只能引用 {{fact.id}},膽敢寫裸數字就整份丟棄回退規則模板。

tech deep-dive

台股研究 Agent 實戰系列(篇 7):Copilot loop——計畫合約、可驗證來源與人類審查

研究請求先變成一份要人批准的 ResearchPlan,外部文件必須完整抓取並驗證逐字引用才能進報告,quant 的審查意見永遠 append-only、free-text 永不回流進 prompt——這是 M5 Copilot loop 的完整樣貌。