
「努力程度」比模型名字更重要
Anthropic 在 Sonnet 5 公告中公布的成本—性能曲線說明:與其只在旗艦與中端之間選邊,不如學會按任務調努力程度。
選模型常常被簡化成假二選一:買貴的旗艦,或將就便宜的中端。Anthropic 的 Sonnet 5 發布材料提出另一套想法:除了型號,使用者還有一個努力程度旋鈕——任務難就多花算力與 token,任務平常就少花一點。
成本—性能曲線在說什麼
公告把 Sonnet 5 與 Sonnet 4.6、Opus 4.8 放在不同努力程度下,對照智能體搜索(BrowseComp)與電腦使用(OSWorld-Verified)。通俗讀法是:Sonnet 5 相對前代是全面提升,它能覆蓋的成本—性能區間在這些圖上比 Opus 4.8 更寬。調到中等努力時,成本效率很突出;把努力拉到最高,部分任務可以和 Opus 4.8 對標。
這才是實務上的重點。你比較不必把「便宜」或「好用」當成永久身份。你可以為最常跑的任務選一個檔位,再在又雜又難的研究、或卡關的電腦使用流程上,把努力程度往上調。
為什麼更高努力會反映在帳單上
努力程度不是免費的裝飾開關。更高努力通常意味著更多 token、更多輪工具調用、更長的執行。Anthropic 表示已同步上調聊天、協作、編碼工具與開放平台的速率限制,以配合高努力使用。首發優惠至 2026 年 8 月 31 日(輸入/輸出每百萬 token 2/10 美元,其後 3/15 美元),也正好適合拿真實負載去試這些檔位。
同一次發布還有一個容易忽略的註腳:Anthropic 後來修正了 BrowseComp 成本—性能圖——最初用了簡化測算法,低估了 Sonnet 5,之後改成與系統卡一致的標準方法。對讀者來說,教訓不大卻有用:把發布圖表當成會更新的文件,並優先採信實驗室聲稱與標準評估一致的算法。
一個簡單的選擇方法
若 Sonnet 5 材料只記住一套做法,記住這個就夠:
- 先看任務難度,而不是品牌階梯
- 重複性工作,默認用中等努力
- 只有在完成率或質量明顯不夠時,才提高努力
- 只有旋鈕仍不夠的那一小部分工作,再留給旗艦模型
更深一層的產品變化是:「用哪個模型」和「它該多努力」正在變成兩個旋鈕。對預算是好事,對粗糙對比卻是提醒——同樣寫在帳單上的型號,低努力與拉滿努力,並不是同一種產品體驗。