
人類覺得難不難,預測不了 Agent 要花多少錢
人類依解題時間標的難度,與 Agent 實際 Token 消耗幾乎弱相關;前沿模型對自身消耗的自預測也系統性低估,尤其是輸入 Token。
很自然的期望是:資深工程師掃一眼工單,就能猜 Agent 會花多少;或者讓 Agent 先探索一下,再自己報價。2026 年在 OpenHands 與 SWE-bench Verified 上的研究顯示,這兩種期望都偏弱。
人類難度幾乎是另一條軸
在 SWE-bench Verified 中,專業程式員依預期解題時間把任務分成三檔:少於 15 分鐘、15 分鐘到 1 小時、大於 1 小時。與 Agent 實際 Token 消耗相比,肯德爾相關係數僅約 0.32,屬極弱相關。
- 約 6.7% 人類標為「少於 15 分鐘」的簡單題,實際消耗仍高於「大於 1 小時」困難題的平均值
- 約 11.1% 人類標為「大於 1 小時」的困難題,實際消耗反而低於「少於 15 分鐘」簡單題的平均值
說穿了其實直覺:一個小小語法問題,可能逼 Agent 掃遍大型倉庫;一個看起來很可怕的架構問題,卻可能靠預訓練裡的模式幾輪就解決。人類複雜度與 Agent 計算開銷,不是同一個旋鈕。
讓 Agent 自預測,也只是粗信號
研究團隊把目標改成:保留工具能力去探索倉庫,但不修 bug,而是預估輸入、輸出與總 Token。皮爾遜相關多停在弱到中等;文中突出的較佳數字是 Claude Sonnet 4.5 對輸出 Token 約 0.39,多數模型的輸入預測約在 0.2–0.3。
更糟的是,模型會系統性低估——尤其是輸入 Token。即便實際消耗到數百萬,預測點仍遠低於完美預測對角線。拿掉上下文示例後,低估不但沒消失,反而更嚴重。這比較像結構性盲點:模型難以預判長上下文、多輪交互會把輸入帳單炸到什麼程度。
產品上仍有用的做法
運行前的精確報價是個壞承諾。粗粒度信號仍然有用:預算上限、消耗預警、中途授權,以及承認 Agent 波動的定價。不要把「這題感覺簡單」當成成本預測——也不要把 Agent 的自估當成確定發票。