
同一题跑两次,账单可以差三十倍
在 SWE-bench Verified 的 Agent 实验中,Token 消耗不仅任务之间差距巨大,连同一任务重复运行也可能差数倍到数十倍。
若你曾看过 Agent 在「看起来很简单」的修补上烧光额度,或任务失败却仍被扣一大笔费用,你大概已感受到整个产业的痛点:成本不透明、结果不保底、消耗难预估。2026 年多机构在 OpenHands 与 SWE-bench Verified 上的研究,把这种感觉量化了。
跨任务来看,差距极其巨大
研究团队把 500 个任务按平均 Token 消耗排序后发现:最贵任务比最便宜任务多消耗约 700 万 Token。成本越高的任务,不同运行轮次之间的方差也越大——贵的不只是贵,还极度不稳定。
同一任务跑四次,仍是移动靶
为了检验同一议题是否有「典型账单」,团队对同一任务、同一模型做四次重复运行,并比较最贵与最便宜的一轮。平均而言,最贵约是最便宜的两倍;部分任务甚至达到约 30 倍。
- 不能把过去的一次运行,当成下一次的可靠报价
- 安静成功与绕圈失败,在产品功能上看起来一样,账单却可能完全不同
为什么收费会让人觉得莫名其妙
Agent 会探索:开档、重试修改、跑测试,有时还会绕远路。又因每轮会回灌越来越大的上下文,小小的行为偏离就会变成巨大的 Token 波动。对用户来说,这很像「魔法定价」——同一个 bug,今晚可能十万 Token,明晚可能几百万。
精确的事前预测或许仍难。用户与服务商仍可把波动当成一等公民的产品问题:预算上限、硬停止、提前预警,以及 Agent 继续花钱前的明确授权。数据里不舒服的真相很简单——Agent 的 Token 用量,不是稳定单价。