兩個代理面對同一任務卻展現截然不同工具使用習慣的示意插圖

模型省不省錢,看行為習慣,不看題目難不難

在同一套 OpenHands 與 SWE-bench Verified 設定下,前沿模型之間的 Token 效率差距極大;即便篩成「全對」或「全錯」子集,消耗排名仍幾乎不變。