
为什么这一代更强调「快一倍」,而不是刷分
依据扬·杜布瓦对 GPT 世代进度的公开说法:最值得自豪的产品成果,可能是整条延迟—性能曲线左移,而不是某一项炫技分数。
旗舰模型一出,大声的问题总是那几句:多了什么炫技?榜单刷了多少分?身为核心研发者,杜布瓦的回答却近乎朴素:他最自豪的,是日常任务大约整体快一倍的效率,以及全公司朝同一颗北极星对齐。
这套说法重要,因为用户体感活在时间与信任上,不活在榜单某一格。稍微更聪明、却又慢又躁的模型,往往输给够好、更快、更稳的那一个。
把整条曲线往左推
杜布瓦用一张心智图说明:横轴是延迟,纵轴是模型性能。研发目标是把整条曲线往左推——用更少思考(更少 token、更短真实时间)达到同等准确率,或在同等延迟下把准确率大幅拉高。
两边要一起发力:推理优化把 token 数量变成用户感受到的秒数;模型侧则让思考更短、瞄得更准。两边同时动,才会在大多数日常任务上呈现「更快、更准、更省心」——而不是只在某个演示角落赢一次。
Pro 不是「更聪明」,而是被允许想更久
在同一张图上,Pro 这类档位常常只是曲线的远端:更多测试时算力、更长推理、在难题上投入更多资源。杜布瓦那句直白话——Pro 不是更聪明,而是被允许想更久——对以为徽章背后另有一个大脑的买家很有用。
不同工作想要曲线上的不同位置。习惯在对话里来回迭代的人,可能很少需要跑一两小时的背景任务;死磕深数学或研究题的人,却可能乐意把 Pro 式任务丢到后台一两小时。产品问题是:你能不能在曲线上滑动,而不只是拥有顶部铭牌。
效率像专家判断,不像乱试一通
杜布瓦的类比:本科生处理专业任务,可能花一两天把可能性都扫一遍;真正的专家会很快锁定方向,并提早打断死胡同。强化学习在这个叙事里,是在训练更像专家的判断——更高概率走上有用路径、更早停掉错误思路——于是推理变便宜,却不必靠卡通式的「智商暴涨」。
对齐也是产品的一部分
他强调的另一个「无聊」成就,是公司级目标对齐:许多垂直团队,却共用一个节点——做出稳定、高效、实用的好模型。在习惯分头刷分的行业里,这种协同很稀缺;它会反映在各种优化能否真正融进一个可发布的系统。
对选模型的读者来说,重点很实务:看你真实任务上感受到的延迟—性能取舍;弄清「Pro」买的是更长思考时间,不是另一物种的智力;把榜单尖峰当线索,而不是整个产品故事。