
大模型心里在想什么,终于能「读成字」了
Anthropic 的自然语言自编码器(NLA)把高维激活直接译成可读文字,无需标注,让可解释性更像「阅读」而非解码特征清单。
在 Claude、GPT、Llama 等主流语言模型里,一次前向计算的「工作记忆」以高维激活向量的形式藏在残差流中。这些数字承载模型理解了什么、预期下一个词是什么,有时也包括它没说出口的考量。问题是:人类无法盯着上万个浮点数就读懂含义——好比拿到超级计算机内部的电流数据,却没有电路逻辑图。
过去两条路,都差一截
像稀疏自编码器(SAE)这类无监督特征工具,可以把激活拆成许多固定特征——有帮助,但仍需人类再用日常语言二次解读。有监督的激活描述则另一极端:必须依赖标注真值,适用范围很窄。Anthropic 提出的自然语言自编码器(NLA)走第三条路:无监督、直接,而且输出本身就是自然语言。
一个翻译官,一个反向翻译官
NLA 由两个基于大模型的模块组成。激活描述器(AV)把激活向量映射成一段文字解释;激活重构器(AR)再把这段文字尽量映回原始激活。联合训练只优化一件事:重构误差要小。过程中并没有明确要求 AV「必须忠实、必须好读」——但随着训练推进,解释往往越来越能对应模型真实的内部状态。
可以把 AV 想成把模型的「数字语言」译成人类语言的翻译官,AR 则是反向翻译官。若来回翻译后仍接近原始数字,中间那段文字就必须保住了某些真实信息。因此 NLA 比较不像翻特征词典,而更像读一则关于「模型当时在做什么」的便条。
先预热,再强化学习
若直接把目标模型权重复制给 AV 与 AR,训练极不稳定:AV 从未把激活当输入,容易输出乱码。研究者先用「激活—摘要」对做监督预热,再进入强化学习:AV 生成解释,AR 学习重构,重构越好 AV 奖励越高,并用流畅度惩罚防止文字崩坏。方差解释率(FVE)会从预热后的中等水准,升到相当不错的重构效果。
对实验室之外的读者意味着什么
NLA 并不会让黑盒瞬间透明,但它改变了接口:除了浏览稀疏特征,你还能拿到一段关于激活的文字素描,有时甚至能透过改写那段文字来干预。对产品与安全团队来说,这既是技术进展,也是文化转变——可解释性开始像「阅读并压力测试解释」,而不只是替匿名维度打分。接下来更关键的问题是:当模型嘴上不说时,这些解释能抓到什么。