
同一個骨架,GPT、Claude、LLaMA 差在哪?
下一詞預測、解碼參數、後訓練,以及逐漸收斂的現代 Transformer 技術棧——熟悉的模型名字,真正差在哪。
GPT、Claude、Gemini、LLaMA——這些名字天天聽到。公開細節有限,尤其是封閉模型;但大圖景很清楚:它們大多坐落在同一套 Transformer 設計空間裏。分詞、嵌入、位置訊號、堆疊的多頭注意力與前饋網絡、殘差流、歸一化,以及下一詞預測循環,構成共通骨架。
生成循環怎麼跑
各層處理結束後,生成時通常只取最後一個 token 的最終向量,把它變成詞表中每個候選的分數——logits,還不是機率。softmax 再把 logits 變成下一個 token 的分佈。模型通常不會每次都死板選最高分;temperature、top-k、top-p 控制輸出有多確定或多多樣。選出一個 token 就接到輸入末尾,盡量複用 KV 緩存,循環直到終止符或上下文上限。
你讀到的整段回答,就是這個循環一次一個 token 跑出來的。幕後常見的效率創新是投機解碼:小而快的草稿模型先猜若干 token,大模型並行驗證;猜得準時,輸出分佈可與單獨跑大模型一致,速度卻更快。
基礎模型只學「下一個詞」
一個常被忽略的事實:在海量文本上「預測下一個最可能的 token」,就是基礎大語言模型的全部訓練訊號。基礎模型並沒有被直接針對事實準確、對話禮貌、寫代碼風格或安全行為來訓練。你感受到的遵循指令、偏好對齊、安全表現,大多是後訓練在基礎模型之上微調出來的——同一副骨架,對用戶表現可以差很多。
模型真正分叉的三處
- 權重:在不同數據與訓練配方下學出來的具體數字——仍是最核心差異。
- 配置:層數、詞表大小、注意力頭布局、總參數量、稠密架構還是混合專家(MoE)。
- 後訓練:指令微調、人類反饋對齊、安全控制——對最終用戶體驗影響極大。
收斂的工具箱,以及耐久的部分
大約 2023 到 2025 年,許多前沿與開放權重模型收斂到相近選擇:pre-norm、RMSNorm、RoPE、SwiGLU、分組查詢注意力,最大的系統往往再加 MoE。這些不是一家公司一次發明的整包方案,而是不同團隊在 2017 年原始設計之上打磨約五年後,各自走到幾乎相同的工程答案。
這種收斂在機器學習史上其實少見——過去圖像、語言、音訊往往各有專用結構。現在 Transformer 式模型橫跨多模態。Mamba 這類狀態空間模型與各種混合架構,尤其在超長序列上仍可能改寫局面。但耐久的問題仍在:把文字變成單元、賦予意義與順序、在序列上交換資訊、在每位點做深加工、讓極深堆疊數值穩定,並一步步預測下一個單元。弄懂這些部件,再看新論文,就比較像在問「他們改了哪個零件」,而不是天書。