此为历史版本和 IPFS 入口查阅区,回到作品页
Yohji Sakamoto
IPFS 指纹 这是什么

作品指纹

真的有人把 mini-swe-agent 用在日常除錯或開發嗎?

Yohji Sakamoto
·
·
同一批除錯任務下,mini-swe-agent 的 token 更少、成功率更高;也分享只改執行方式的消融結果。

前陣子看到 DeepSWE 比較不同 agent harness,我就用同一批除錯任務、同一個 GPT-5.6 SOL High 自己跑了一輪。

結果滿意外的:

- Codex CLI High:151.91M tokens,成功率 60%

- 原版 mini-swe-agent:70.33M tokens,成功率 67%

- prompt 不變,只替 mini harness 加上巨集命令執行:60.59M tokens,成功率 78%

換句話說,在這批任務裡,原版 mini-swe-agent 比 Codex 少用了約 54% token,成功率高 7 個百分點。只改執行方式的消融實驗裡,token 又少了約 14%,成功率再多 11 個百分點。

這當然不能證明它在每個專案都比較好。DeepSWE 也提醒,system prompt 和評分方式的契合可能解釋部分差距。不過如果工作主要是找 bug、改程式、跑測試,這種「只有 bash 加線性歷史」的極簡架構確實很有意思。

有人真的把它用在日常除錯或功能開發嗎?離開 benchmark 之後,最先碰到的是環境、長時間測試、權限,還是 patch 品質問題?

- 我的測試:turaai.net/benchmark

- mini-swe-agent:github.com/swe-agent...

- DeepSWE 說明:deepswe.datacurve.ai...

揭露:我維護 Tura,上面的 benchmark 是我自己跑的。

CC BY-NC-ND 4.0 授权