
同一題跑兩次,帳單可以差三十倍
在 SWE-bench Verified 的 Agent 實驗中,Token 消耗不僅任務之間差距巨大,連同一任務重複運行也可能差數倍到數十倍。
若你曾看過 Agent 在「看起來很簡單」的修補上燒光額度,或任務失敗卻仍被扣一大筆費用,你大概已感受到整個產業的痛點:成本不透明、結果不保底、消耗難預估。2026 年多機構在 OpenHands 與 SWE-bench Verified 上的研究,把這種感覺量化了。
跨任務來看,差距極其巨大
研究團隊把 500 個任務按平均 Token 消耗排序後發現:最貴任務比最便宜任務多消耗約 700 萬 Token。成本越高的任務,不同運行輪次之間的方差也越大——貴的不只是貴,還極度不穩定。
同一任務跑四次,仍是移動靶
為了檢驗同一議題是否有「典型帳單」,團隊對同一任務、同一模型做四次重複運行,並比較最貴與最便宜的一輪。平均而言,最貴約是最便宜的兩倍;部分任務甚至達到約 30 倍。
- 不能把過去的一次運行,當成下一次的可靠報價
- 安靜成功與繞圈失敗,在產品功能上看起來一樣,帳單卻可能完全不同
為什麼收費會讓人覺得莫名其妙
Agent 會探索:開檔、重試修改、跑測試,有時還會繞遠路。又因每輪會回灌越來越大的上下文,小小的行為偏離就會變成巨大的 Token 波動。對用戶來說,這很像「魔法定價」——同一個 bug,今晚可能十萬 Token,明晚可能幾百萬。
精確的事前預測或許仍難。用戶與服務商仍可把波動當成一等公民的產品問題:預算上限、硬停止、提前預警,以及 Agent 繼續花錢前的明確授權。數據裏不舒服的真相很簡單——Agent 的 Token 用量,不是穩定單價。