
为什么更强的模型,往往也更「守规矩」?
Anthropic 关于 Sonnet 5 的安全说明提示一个有用的分拆:中端模型在日常智能体场景可以更安全,但高风险网安技能与旗舰仍有巨大差距。
当中端模型突然更会把智能体任务做完,人们自然会担心:「更强」是不是也代表「更危险」?Anthropic 对 Sonnet 5 的安全说明给出的画面更细:在不少日常安全维度上,它比 Sonnet 4.6 更好;但在高风险网络安全技能上,它仍远低于旗舰级模型——且默认防护也反映了这个判断。
日常智能体场景,整体更安全
按发布公告摘要,部署前评估显示 Sonnet 5 整体安全性优于 Sonnet 4.6。在智能体安全上,它更擅长拒绝恶意请求,也更能抵抗提示注入的劫持尝试。幻觉与谄媚比例更低。在覆盖协助滥用、欺骗等不当行为的自动化行为审计中,Sonnet 5 总分更低,也就是不当行为更少。
梯度仍然存在。与能力更强的 Opus 4.8、Claude Mythos Preview 相比,Sonnet 5 在这项审计上的不当行为发生率仍略高。这符合 Anthropic 一贯的安全阶梯逻辑:基础能力越强,对齐表现往往也越好。中端正好落在中间——优于前代,却不等于产品线顶端。
网安技能,仍是档位差距最明显之处
Anthropic 写得很清楚:并未针对网安任务专门训练 Sonnet 5。它能做一些常规、无伤害的网络工作;但在可能危险的技能评估——例如编写漏洞利用程序——上,表现远逊于 Opus 4.8 与 Mythos 5。在与 Mozilla 合作、针对 Firefox 147 漏洞(已在 148 修复)的测试中,两款 Sonnet 都未能生成完整可用的利用程序。Sonnet 5 的部分成功率仅略高于前代,官方倾向视为通用智能进步的副产品,而非专项优化。
由于 Sonnet 5 在这些任务上仍略强于前代,发布时默认开启网络安全防护——实时检测并阻断危险网络使用,等级与 Opus 4.7、4.8 一致,但严格程度低于 Fable 5 上更宽的拦截规则;官方对 Sonnet 5 的整体网安风险判断为较低。若是需要放宽防护的专业网安工作,官方仍更推荐 Opus 4.8,并说明 Sonnet 5 已纳入网络安全验证计划,于 Claude 原生平台、AWS 与微软 Foundry 开放,Vertex 版本亦将跟上。
买家该怎么读这条安全阶梯
- 「比上一代中端更安全」≠「与顶端模型一样对齐」
- 日常智能体好用程度,与高风险网安能力,可以不同步前进
- 默认防护是产品的一部分,不只是安全团队才需要看的注脚
有用的收获是把营销常混在一起的两个问题拆开。第一:这个模型会不会拒绝不该做的事,并在普通自动化里站得稳?第二:这个档位是否具备你的安全工作流真正需要的高风险专业技能——以及对应的准入计划?Sonnet 5 的公开安全叙事说明:中端可以在第一点上进步,却不必跃进第二点。正因如此,「更强且往往更守规矩」可以成立,「所有强模型都能互换」仍然不成立。