
Agent 的錢,其實花在「讀上下文」而不是「寫答案」
2026 年多機構研究顯示:Agentic Coding 的成本由輸入 Token 主導——平均每寫出 1 個輸出 Token,就要處理約 154 個輸入 Token。
很多人仍把 AI 成本想成「模型打出很長一段回答」。對聊天來說,這個直覺大致成立。但對會打開程式庫、呼叫工具、多輪迭代的程式碼 Agent 來說,帳單不一樣:錢多半花在讀取不斷累積的上下文,而不是生成下一段修補。
同樣叫「寫程式」,帳單差幾個數量級
研究團隊以主流開源程式碼 Agent 框架 OpenHands,在 SWE-bench Verified(500 個真實 GitHub 議題,附完整倉庫與測試)上,對八款前沿模型做實驗,並重複運行以降低單次偶然性。
他們把與程式相關的工作分成三類。程式推理:單輪、無工具的答題;程式對話:多輪程式聊天;Agentic Coding:Agent 自主完成倉庫級任務。
- Agentic Coding 的平均 Token 消耗,約為程式推理的 3,500 倍、程式對話的 1,200 倍
- 貨幣成本:Agentic 單任務平均約 1.857 美元,推理約 0.023 美元,對話約 0.016 美元
那個會翻轉直覺的比例
一般程式對話與推理的輸入/輸出比大約是 1.33:1 與 1.19:1;Agentic Coding 卻高達約 153.85:1。白話說:Agent 每生成 1 個輸出 Token,往往要處理約 154 個輸入 Token。
為什麼?因為這類任務是長上下文、多輪交互:倉庫內容、工具結果、歷史對話會不斷塞回提示。即便開了 Token 快取,每輪仍要處理的輸入量仍會急遽成長。貴的習慣是反覆讀那一疊越來越高的材料——不是寫下一句短指令。
對買單的人意味著什麼
想省 Agent 的錢,重點往往不是「讓模型少說話」,而是管好它持續在讀什麼:收窄範圍、減少重複開檔、設清楚停止條件,以及避免每輪把整段歷史原封不動灌回去。Agent 成本從來主要不是生成帳單,而是上下文帳單。