
「努力程度」比模型名字更重要
Anthropic 在 Sonnet 5 公告中公布的成本—性能曲线说明:与其只在旗舰与中端之间选边,不如学会按任务调努力程度。
选模型常常被简化成假二选一:买贵的旗舰,或将就便宜的中端。Anthropic 的 Sonnet 5 发布材料提出另一套想法:除了型号,用户还有一个努力程度旋钮——任务难就多花算力与 token,任务平常就少花一点。
成本—性能曲线在说什么
公告把 Sonnet 5 与 Sonnet 4.6、Opus 4.8 放在不同努力程度下,对照智能体搜索(BrowseComp)与电脑使用(OSWorld-Verified)。通俗读法是:Sonnet 5 相对前代是全面提升,它能覆盖的成本—性能区间在这些图上比 Opus 4.8 更宽。调到中等努力时,成本效率很突出;把努力拉到最高,部分任务可以和 Opus 4.8 对标。
这才是实务上的重点。你比较不必把「便宜」或「好用」当成永久身份。你可以为最常跑的任务选一个档位,再在又杂又难的研究、或卡关的电脑使用流程上,把努力程度往上调。
为什么更高努力会反映在账单上
努力程度不是免费的装饰开关。更高努力通常意味着更多 token、更多轮工具调用、更长的执行。Anthropic 表示已同步上调聊天、协作、编码工具与开放平台的速率限制,以配合高努力使用。首发优惠至 2026 年 8 月 31 日(输入/输出每百万 token 2/10 美元,其后 3/15 美元),也正好适合拿真实负载去试这些档位。
同一次发布还有一个容易忽略的注脚:Anthropic 后来修正了 BrowseComp 成本—性能图——最初用了简化测算法,低估了 Sonnet 5,之后改成与系统卡一致的标准方法。对读者来说,教训不大却有用:把发布图表当成会更新的文件,并优先采信实验室声称与标准评估一致的算法。
一个简单的选择方法
若 Sonnet 5 材料只记住一套做法,记住这个就够:
- 先看任务难度,而不是品牌阶梯
- 重复性工作,默认用中等努力
- 只有在完成率或质量明显不够时,才提高努力
- 只有旋钮仍不够的那一小部分工作,再留给旗舰模型
更深一层的产品变化是:「用哪个模型」和「它该多努力」正在变成两个旋钮。对预算是好事,对粗糙对比却是提醒——同样写在账单上的型号,低努力与拉满努力,并不是同一种产品体验。