之前看 deep swe 说 https://github.com/swe-agent/mini-swe-agent 比 codex 和 claude code 在 debug 中的 token 消耗和成功率都要好,我今天自己跑了一下,用 gpt5.6 sol 开 high 基本 token 开销比 codex 少 50%,成功率也高 15%左右。下面是我跑的测试数据: https://turaai.net/benchmark 本来是想给我的宏命令做消融试验,但是单独只是改执行,不改提示词,token 消耗其实只减少了 16%左右,成功率提高 11%左右。
下面是 deepswe 官方的解释: https://deepswe.datacurve.ai/blog/deepswe
简而言之如果光 debug mini swe agent 好像明显好过模型厂商的官方 agent harness 。