不同档位 AI 模型安全梯度与防护盾牌的示意插图

为什么更强的模型,往往也更「守规矩」?

Anthropic 关于 Sonnet 5 的安全说明提示一个有用的分拆:中端模型在日常智能体场景可以更安全,但高风险网安技能与旗舰仍有巨大差距。