
模型省不省钱,看行为习惯,不看题目难不难
在同一套 OpenHands 与 SWE-bench Verified 设定下,前沿模型之间的 Token 效率差距极大;即便筛成「全对」或「全错」子集,消耗排名仍几乎不变。
当某个 Agent 完成仓库任务只花了另一个模型的一小部分 Token,最省事的解释是「那题对它比较简单」。2026 年对八款前沿模型、OpenHands 与 SWE-bench Verified 的研究给出更尖锐的说法:巨大的效率差距,更像模型的行为习惯——怎么调用工具、怎么在文件间绕路——而不是题目本身有多难。
一张能「感觉到」的散点图
把平均 Token 消耗对上任务准确率,图景很直接:OpenAI 的 GPT-5 与 GPT-5.2 以相对低消耗换得高准确率;Claude Sonnet 4/4.5 与 Qwen3-Coder-480B 属高成本、中高准确率;Kimi-K2 在这组里表现最差——Token 最高、准确率最低。同样 500 题上,Kimi-K2 与 Claude Sonnet 4.5 平均都比 GPT-5 多消耗约 150 万 Token。
「大家都对」与「大家都错」,排名仍不变
为排除难度干扰,研究团队筛了两个子集:所有模型都解对的简单题,以及所有模型都失败的困难题。Token 消耗排名几乎不动。这削弱了「浪费型模型只是因为题更难才贵」的说法:它们默认就更容易做冗余工具调用与重复文件操作——简单题也收不敛,无望题也不会及时止损。
失败有附加费——而且附加费差很多
- 所有模型在失败任务上的 Token 消耗都高于成功任务
- GPT-5/GPT-5.2 失败时的增量不到约 50 万 Token;Kimi-K2 的失败溢价可高达约 200 万
高效模型更像能察觉「这题做不成了」并停手;低效模型则会探索到资源耗尽。为 Agent 选模型时,只看榜单准确率并不够,还要看习惯档案:成功时烧多少,失败时会乱转到什么地步。