我做了一套可重現的測試框架,專門驗證「省 Token」工具到底有沒有用
大家好,我是 Yu。這個月初我公開了 Tura,也分享過為什麼評估 Agent Harness 不能只看一次短 Demo,而要看更長、更完整的任務。
最近兩週,我看到愈來愈多人開始測試 RTK、Ponytail 這類節省 Token 的工具。這是好事,但每個人使用的任務、日誌和結果格式都不一樣,數字其實很難直接比較。
所以我把自己使用的基準測試框架開源了:
它可以統一安排測試流程,把日誌和產出轉成同一種結果格式。只要把結果資料夾提交到儲存庫,CI 就會自動建立索引,網站端再產生比較圖和每次執行的詳細頁面。
如果你有想測試的工具、Harness 或測試案例,可以直接告訴我。你也可以在本機重跑同一套評估,再透過 Pull Request 提交結果資料夾,後面的索引工作會由 CI 自動完成。
我特別想聽聽大家覺得下一步應該測什麼,以及這套方法本身可能有哪些偏差。
利益揭露:我是 Tura 和這套基準測試框架的維護者。