
Agent 的钱,其实花在「读上下文」而不是「写答案」
2026 年多机构研究显示:Agentic Coding 的成本由输入 Token 主导——平均每写出 1 个输出 Token,就要处理约 154 个输入 Token。
很多人仍把 AI 成本想成「模型打出很长一段回答」。对聊天来说,这个直觉大致成立。但对会打开代码库、调用工具、多轮迭代的代码 Agent 来说,账单不一样:钱多半花在读取不断累积的上下文,而不是生成下一段修补。
同样叫「写程序」,账单差几个数量级
研究团队以主流开源代码 Agent 框架 OpenHands,在 SWE-bench Verified(500 个真实 GitHub 议题,附完整仓库与测试)上,对八款前沿模型做实验,并重复运行以降低单次偶然性。
他们把与程序相关的工作分成三类。程序推理:单轮、无工具的答题;程序对话:多轮程序聊天;Agentic Coding:Agent 自主完成仓库级任务。
- Agentic Coding 的平均 Token 消耗,约为程序推理的 3,500 倍、程序对话的 1,200 倍
- 货币成本:Agentic 单任务平均约 1.857 美元,推理约 0.023 美元,对话约 0.016 美元
那个会翻转直觉的比例
一般程序对话与推理的输入/输出比大约是 1.33:1 与 1.19:1;Agentic Coding 却高达约 153.85:1。白话说:Agent 每生成 1 个输出 Token,往往要处理约 154 个输入 Token。
为什么?因为这类任务是长上下文、多轮交互:仓库内容、工具结果、历史对话会不断塞回提示。即便开了 Token 缓存,每轮仍要处理的输入量仍会急剧增长。贵的习惯是反复读那一叠越来越高的材料——不是写下一句短指令。
对买单的人意味着什么
想省 Agent 的钱,重点往往不是「让模型少说话」,而是管好它持续在读什么:收窄范围、减少重复开档、设清楚停止条件,以及避免每轮把整段历史原封不动灌回去。Agent 成本从来主要不是生成账单,而是上下文账单。