
同一个骨架,GPT、Claude、LLaMA 差在哪?
下一词预测、解码参数、后训练,以及逐渐收敛的现代 Transformer 技术栈——熟悉的模型名字,真正差在哪。
GPT、Claude、Gemini、LLaMA——这些名字天天听到。公开细节有限,尤其是封闭模型;但大图景很清楚:它们大多坐落在同一套 Transformer 设计空间里。分词、嵌入、位置信号、堆叠的多头注意力与前馈网络、残差流、归一化,以及下一词预测循环,构成共通骨架。
生成循环怎么跑
各层处理结束后,生成时通常只取最后一个 token 的最终向量,把它变成词表中每个候选的分数——logits,还不是概率。softmax 再把 logits 变成下一个 token 的分布。模型通常不会每次都死板选最高分;temperature、top-k、top-p 控制输出有多确定或多多样。选出一个 token 就接到输入末尾,尽量复用 KV 缓存,循环直到终止符或上下文上限。
你读到的整段回答,就是这个循环一次一个 token 跑出来的。幕后常见的效率创新是投机解码:小而快的草稿模型先猜若干 token,大模型并行验证;猜得准时,输出分布可与单独跑大模型一致,速度却更快。
基础模型只学「下一个词」
一个常被忽略的事实:在海量文本上「预测下一个最可能的 token」,就是基础大语言模型的全部训练信号。基础模型并没有被直接针对事实准确、对话礼貌、写代码风格或安全行为来训练。你感受到的遵循指令、偏好对齐、安全表现,大多是后训练在基础模型之上微调出来的——同一副骨架,对用户表现可以差很多。
模型真正分叉的三处
- 权重:在不同数据与训练配方下学出来的具体数字——仍是最核心差异。
- 配置:层数、词表大小、注意力头布局、总参数量、稠密架构还是混合专家(MoE)。
- 后训练:指令微调、人类反馈对齐、安全控制——对最终用户体验影响极大。
收敛的工具箱,以及耐久的部分
大约 2023 到 2025 年,许多前沿与开放权重模型收敛到相近选择:pre-norm、RMSNorm、RoPE、SwiGLU、分组查询注意力,最大的系统往往再加 MoE。这些不是一家公司一次发明的整包方案,而是不同团队在 2017 年原始设计之上打磨约五年后,各自走到几乎相同的工程答案。
这种收敛在机器学习史上其实少见——过去图像、语言、音频往往各有专用结构。现在 Transformer 式模型横跨多模态。Mamba 这类状态空间模型与各种混合架构,尤其在超长序列上仍可能改写局面。但耐久的问题仍在:把文字变成单元、赋予意义与顺序、在序列上交换信息、在每位点做深加工、让极深堆叠数值稳定,并一步步预测下一个单元。弄懂这些部件,再看新论文,就比较像在问「他们改了哪个零件」,而不是天书。