
為什麼更強的模型,往往也更「守規矩」?
Anthropic 關於 Sonnet 5 的安全說明提示一個有用的分拆:中端模型在日常智能體場景可以更安全,但高風險網安技能與旗艦仍有巨大差距。
當中端模型突然更會把智能體任務做完,人們自然會擔心:「更強」是不是也代表「更危險」?Anthropic 對 Sonnet 5 的安全說明給出的畫面更細:在不少日常安全維度上,它比 Sonnet 4.6 更好;但在高風險網路安全技能上,它仍遠低於旗艦級模型——且默認防護也反映了這個判斷。
日常智能體場景,整體更安全
按發布公告摘要,部署前評估顯示 Sonnet 5 整體安全性優於 Sonnet 4.6。在智能體安全上,它更擅長拒絕惡意請求,也更能抵抗提示注入的劫持嘗試。幻覺與諂媚比例更低。在覆蓋協助濫用、欺騙等不當行為的自動化行為審計中,Sonnet 5 總分更低,也就是不當行為更少。
梯度仍然存在。與能力更強的 Opus 4.8、Claude Mythos Preview 相比,Sonnet 5 在這項審計上的不當行為發生率仍略高。這符合 Anthropic 一貫的安全階梯邏輯:基礎能力越強,對齊表現往往也越好。中端正好落在中間——優於前代,卻不等於產品線頂端。
網安技能,仍是檔位差距最明顯之處
Anthropic 寫得很清楚:並未針對網安任務專門訓練 Sonnet 5。它能做一些常規、無傷害的網路工作;但在可能危險的技能評估——例如編寫漏洞利用程序——上,表現遠遜於 Opus 4.8 與 Mythos 5。在與 Mozilla 合作、針對 Firefox 147 漏洞(已在 148 修復)的測試中,兩款 Sonnet 都未能生成完整可用的利用程序。Sonnet 5 的部分成功率僅略高於前代,官方傾向視為通用智能進步的副產品,而非專項優化。
由於 Sonnet 5 在這些任務上仍略強於前代,發布時默認開啟網路安全防護——即時偵測並阻斷危險網路使用,等級與 Opus 4.7、4.8 一致,但嚴格程度低於 Fable 5 上更寬的攔截規則;官方對 Sonnet 5 的整體網安風險判斷為較低。若是需要放寬防護的專業網安工作,官方仍更推薦 Opus 4.8,並說明 Sonnet 5 已納入網路安全驗證計劃,於 Claude 原生平台、AWS 與微軟 Foundry 開放,Vertex 版本亦將跟上。
買家該怎麼讀這條安全階梯
- 「比上一代中端更安全」≠「與頂端模型一樣對齊」
- 日常智能體好用程度,與高風險網安能力,可以不同步前進
- 默認防護是產品的一部分,不只是安全團隊才需要看的註腳
有用的收穫是把行銷常混在一起的兩個問題拆開。第一:這個模型會不會拒絕不該做的事,並在普通自動化裏站得穩?第二:這個檔位是否具備你的安全工作流真正需要的高風險專業技能——以及對應的准入計劃?Sonnet 5 的公開安全敘事說明:中端可以在第一點上進步,卻不必躍進第二點。正因如此,「更強且往往更守規矩」可以成立,「所有強模型都能互換」仍然不成立。