两个代理面对同一任务却展现截然不同工具使用习惯的示意插图

模型省不省钱,看行为习惯,不看题目难不难

在同一套 OpenHands 与 SWE-bench Verified 设定下,前沿模型之间的 Token 效率差距极大;即便筛成「全对」或「全错」子集,消耗排名仍几乎不变。