
中端模型为何突然能「做智能体」?
根据 Anthropic 发布 Claude Sonnet 5 的公开说明,用通俗说法解释:旗舰级智能体能力,正在下沉到中端价位。
很长一段时间里,「智能体 AI」听起来像旗舰级奢侈品:能自己做计划、会调工具、还能在没人盯着每一步的情况下做完多步骤工作。Anthropic 的 Sonnet 5 公告讲的故事更直接:不久前主要出现在更大、更贵的 Opus 级模型上的能力,现在开始出现在中端 Sonnet 线——在不少智能体任务上已经足够接近,足以改变团队日常怎么选模型。
智能体曾靠中端起步,后来差距被拉开
Anthropic 自己也写到:对许多开发者来说,智能体时代是从 Sonnet 级模型开始的。Claude Sonnet 3.5、3.6、3.7 是第一批在编码与工具调用上拿出亮眼表现、且成本还能被团队接受的模型。不过在那之后,最明显的智能体突破,大多集中在 Opus;中端仍好用,旗舰则在长程跟进上把差距拉开。
Sonnet 5 被定位成要补上这段落差。官方说法是:这是迄今智能体属性最强的一款 Sonnet——能制定计划、调用浏览器与终端这类工具,并在多步骤任务上减少人工干预。用 Anthropic 自己的对比语言,表现已接近 Opus 4.8,定价仍落在 Sonnet 档位。
「接近旗舰」在实务上意味着什么
不必背下每一项基准分数。更有用的画面是:在 Anthropic 公开的智能体编码、有工具辅助的推理,以及知识工作评估上,把 Sonnet 5 与 Sonnet 4.6、Opus 4.8 并排看,中端与旗舰的差距已被大幅压缩。在某些综合知识工作分数上,官方甚至报告 Sonnet 5 略高于 Opus 4.8——对中端线来说少见,较稳妥的读法是「中间档不再明显更弱」,而不是永久排名。
同一公告里早期接入伙伴的说法,往往比图表更具体。软件团队提到:在混乱的技术环境里,多步骤开发执行层更扎实。自动化厂商则描述复合任务——一边更新客户系统的账号等级,一边向企业联系人发送发布公告——前代常做到一半卡住,Sonnet 5 能端到端跑完。对日常流程来说,把事情做完,常常比基准多两分更有价值。
普通人为什么要在意
能力下沉不只是实验室叙事。当智能体技能落到中端价位,更多团队能用接近生产的工作流去试,而不必把每一次运行都当成奢侈消费。Anthropic 把 Sonnet 5 设为免费版与专业版的默认模型,并在高级、团队、企业、Claude Code 与 API 同步提供——这是把「中端智能体」当新常态,而不是测试玩具。
- 常规编程、知识处理、中等复杂度智能体:中端往往是务实的首选
- 极高准确度要求,或专业网安场景:旗舰线仍可能更合适
- 是否全面切换:用自己真实、杂乱的任务测,而不只看演示提示词
行业信号比单一型号更大。当昨天旗舰智能体行为的八九成,能以远低于旗舰的成本拿到,「普通模型能做完什么」的基线就被抬高。旧的奢侈品落差被压缩——买家也会被推向一个更尖锐的问题:不是「哪家最大」,而是「哪个档位能以我愿意重复支付的价格,做完我的流程」。