
模型省不省錢,看行為習慣,不看題目難不難
在同一套 OpenHands 與 SWE-bench Verified 設定下,前沿模型之間的 Token 效率差距極大;即便篩成「全對」或「全錯」子集,消耗排名仍幾乎不變。
當某個 Agent 完成倉庫任務只花了另一個模型的一小部分 Token,最省事的解釋是「那題對它比較簡單」。2026 年對八款前沿模型、OpenHands 與 SWE-bench Verified 的研究給出更尖銳的說法:巨大的效率差距,更像模型的行為習慣——怎麼呼叫工具、怎麼在檔案間繞路——而不是題目本身有多難。
一張能「感覺到」的散點圖
把平均 Token 消耗對上任務準確率,圖景很直接:OpenAI 的 GPT-5 與 GPT-5.2 以相對低消耗換得高準確率;Claude Sonnet 4/4.5 與 Qwen3-Coder-480B 屬高成本、中高準確率;Kimi-K2 在這組裏表現最差——Token 最高、準確率最低。同樣 500 題上,Kimi-K2 與 Claude Sonnet 4.5 平均都比 GPT-5 多消耗約 150 萬 Token。
「大家都對」與「大家都錯」,排名仍不變
為排除難度干擾,研究團隊篩了兩個子集:所有模型都解對的簡單題,以及所有模型都失敗的困難題。Token 消耗排名幾乎不動。這削弱了「浪費型模型只是因為題更難才貴」的說法:它們預設就更容易做冗餘工具呼叫與重複檔案操作——簡單題也收不斂,無望題也不會及時止損。
失敗有附加費——而且附加費差很多
- 所有模型在失敗任務上的 Token 消耗都高於成功任務
- GPT-5/GPT-5.2 失敗時的增量不到約 50 萬 Token;Kimi-K2 的失敗溢價可高達約 200 萬
高效模型更像能察覺「這題做不成了」並停手;低效模型則會探索到資源耗盡。為 Agent 選模型時,只看榜單準確率並不夠,還要看習慣檔案:成功時燒多少,失敗時會亂轉到什麼地步。