AI Agent 調查資料集與評測架構
評估與雙方比較
這份文件在講什麼(一句話): 目前的五個設計檔案方向正確(三層分離、deterministic-first、dataset-first),但格式互不相容、evidence 會過期、eval 會洩題。兩個獨立 agent 各自審查後給出幾乎相同的修正清單,可以直接照著做。
| # | 先記住的結論 | 為什麼重要 |
|---|---|---|
| 1 | 兩份獨立評估的交集是高信心清單,不是各說各話。 兩個 agent 拿相同來源,獨立得出幾乎相同的 P1 問題(approved 預設、evidence 會過期、洩題、schema 不成契約、SKILL 缺 frontmatter)。 | 這份交集可以直接當修正 backlog,不需要再辯論要不要做。 |
| 2 | Dataset 的第一個路障是 replay,不是工具選型。 一個歷史 incident 要能被重新調查,必須先決定 evidence 用什麼形式保存;沒解決這題,選哪個 eval 平台都沒用。 | 兩份評估都同意:先把 evidence 快照機制做出來,工具晚點選。 |
| 3 | 選 eval runner 前,必須先確認公司 agent 的執行框架。 這題兩份評估都沒能替你回答,卻決定了第一個可行動的下一步。 | 是 Claude Code 系就先試 claude plugin eval;是 Strands/AgentCore 就先試 Strands Evals;都不是就用 promptfoo 包一層 adapter。 |