真的有人把 mini-swe-agent 用在日常除錯或開發嗎?
前陣子看到 DeepSWE 比較不同 agent harness,我就用同一批除錯任務、同一個 GPT-5.6 SOL High 自己跑了一輪。
結果滿意外的:
- Codex CLI High:151.91M tokens,成功率 60%
- 原版 mini-swe-agent:70.33M tokens,成功率 67%
- prompt 不變,只替 mini harness 加上巨集命令執行:60.59M tokens,成功率 78%
換句話說,在這批任務裡,原版 mini-swe-agent 比 Codex 少用了約 54% token,成功率高 7 個百分點。只改執行方式的消融實驗裡,token 又少了約 14%,成功率再多 11 個百分點。
這當然不能證明它在每個專案都比較好。DeepSWE 也提醒,system prompt 和評分方式的契合可能解釋部分差距。不過如果工作主要是找 bug、改程式、跑測試,這種「只有 bash 加線性歷史」的極簡架構確實很有意思。
有人真的把它用在日常除錯或功能開發嗎?離開 benchmark 之後,最先碰到的是環境、長時間測試、權限,還是 patch 品質問題?
- 我的測試:turaai.net/benchmark
- mini-swe-agent:github.com/swe-agent...
- DeepSWE 說明:deepswe.datacurve.ai...
揭露:我維護 Tura,上面的 benchmark 是我自己跑的。