
中端模型為何突然能「做智能體」?
根據 Anthropic 發布 Claude Sonnet 5 的公開說明,用通俗說法解釋:旗艦級智能體能力,正在下沉到中端價位。
很長一段時間裏,「智能體 AI」聽起來像旗艦級奢侈品:能自己做計劃、會調工具、還能在沒人盯著每一步的情況下做完多步驟工作。Anthropic 的 Sonnet 5 公告講的故事更直接:不久前主要出現在更大、更貴的 Opus 級模型上的能力,現在開始出現在中端 Sonnet 線——在不少智能體任務上已經足夠接近,足以改變團隊日常怎麼選模型。
智能體曾靠中端起步,後來差距被拉開
Anthropic 自己也寫到:對許多開發者來說,智能體時代是從 Sonnet 級模型開始的。Claude Sonnet 3.5、3.6、3.7 是第一批在編碼與工具調用上拿出亮眼表現、且成本還能被團隊接受的模型。不過在那之後,最明顯的智能體突破,大多集中在 Opus;中端仍好用,旗艦則在長程跟進上把差距拉開。
Sonnet 5 被定位成要補上這段落差。官方說法是:這是迄今智能體屬性最強的一款 Sonnet——能制定計劃、調用瀏覽器與終端這類工具,並在多步驟任務上減少人工干預。用 Anthropic 自己的對比語言,表現已接近 Opus 4.8,定價仍落在 Sonnet 檔位。
「接近旗艦」在實務上意味著什麼
不必背下每一項基準分數。更有用的畫面是:在 Anthropic 公開的智能體編碼、有工具輔助的推理,以及知識工作評估上,把 Sonnet 5 與 Sonnet 4.6、Opus 4.8 並排看,中端與旗艦的差距已被大幅壓縮。在某些綜合知識工作分數上,官方甚至報告 Sonnet 5 略高於 Opus 4.8——對中端線來說少見,較穩妥的讀法是「中間檔不再明顯更弱」,而不是永久排名。
同一公告裏早期接入夥伴的說法,往往比圖表更具體。軟體團隊提到:在混亂的技術環境裏,多步驟開發執行層更扎實。自動化廠商則描述複合任務——一邊更新客戶系統的帳號等級,一邊向企業聯絡人發送發布公告——前代常做到一半卡住,Sonnet 5 能端到端跑完。對日常流程來說,把事情做完,常常比基準多兩分更有價值。
普通人為什麼要在意
能力下沉不只是實驗室敘事。當智能體技能落到中端價位,更多團隊能用接近生產的工作流去試,而不必把每一次運行都當成奢侈消費。Anthropic 把 Sonnet 5 設為免費版與專業版的默認模型,並在高級、團隊、企業、Claude Code 與 API 同步提供——這是把「中端智能體」當新常態,而不是測試玩具。
- 常規編程、知識處理、中等複雜度智能體:中端往往是務實的首選
- 極高準確度要求,或專業網安場景:旗艦線仍可能更合適
- 是否全面切換:用自己真實、雜亂的任務測,而不只看演示提示詞
行業訊號比單一型號更大。當昨天旗艦智能體行為的八九成,能以遠低於旗艦的成本拿到,「普通模型能做完什麼」的基線就被抬高。舊的奢侈品落差被壓縮——買家也會被推向一個更尖銳的問題:不是「哪家最大」,而是「哪個檔位能以我願意重複支付的價格,做完我的流程」。