
為什麼這一代更強調「快一倍」,而不是刷分
依據揚·杜布瓦對 GPT 世代進度的公開說法:最值得自豪的產品成果,可能是整條延遲—性能曲線左移,而不是某一項炫技分數。
旗艦模型一出,大聲的問題總是那幾句:多了什麼炫技?榜單刷了多少分?身為核心研發者,杜布瓦的回答卻近乎樸素:他最自豪的,是日常任務大約整體快一倍的效率,以及全公司朝同一顆北極星對齊。
這套說法重要,因為使用者體感活在時間與信任上,不活在榜單某一格。稍微更聰明、卻又慢又躁的模型,往往輸給夠好、更快、更穩的那一個。
把整條曲線往左推
杜布瓦用一張心智圖說明:橫軸是延遲,縱軸是模型性能。研發目標是把整條曲線往左推——用更少思考(更少 token、更短真實時間)達到同等準確率,或在同等延遲下把準確率大幅拉高。
兩邊要一起發力:推理優化把 token 數量變成使用者感受到的秒數;模型側則讓思考更短、瞄得更準。兩邊同時動,才會在大多數日常任務上呈現「更快、更準、更省心」——而不是只在某個演示角落贏一次。
Pro 不是「更聰明」,而是被允許想更久
在同一張圖上,Pro 這類檔位常常只是曲線的遠端:更多測試時算力、更長推理、在難題上投入更多資源。杜布瓦那句直白話——Pro 不是更聰明,而是被允許想更久——對以為徽章背後另有一個大腦的買家很有用。
不同工作想要曲線上的不同位置。習慣在對話裏來回迭代的人,可能很少需要跑一兩小時的背景任務;死磕深數學或研究題的人,卻可能樂意把 Pro 式任務丟到後台一兩小時。產品問題是:你能不能在曲線上滑動,而不只是擁有頂部銘牌。
效率像專家判斷,不像亂試一通
杜布瓦的類比:本科生處理專業任務,可能花一兩天把可能性都掃一遍;真正的專家會很快鎖定方向,並提早打斷死胡同。強化學習在這個敘事裏,是在訓練更像專家的判斷——更高機率走上有用路徑、更早停掉錯誤思路——於是推理變便宜,卻不必靠卡通式的「智商暴漲」。
對齊也是產品的一部分
他強調的另一個「無聊」成就,是公司級目標對齊:許多垂直團隊,卻共用一個節點——做出穩定、高效、實用的好模型。在習慣分頭刷分的行業裏,這種協同很稀缺;它會反映在各種優化能否真正融進一個可發布的系統。
對選模型的讀者來說,重點很實務:看你真實任務上感受到的延遲—性能取捨;弄清「Pro」買的是更長思考時間,不是另一物種的智力;把榜單尖峰當線索,而不是整個產品故事。