
强化学习最接近真正智能,差的是什么?
在各类 AI 范式中,强化学习最接近「透过互动学习」;但 Sutton 与 Rafiee 指出,仍有三个关键落差,使它尚未等同生成认知。
若问哪一个 AI 分支最像「活在世界里的 Agent」,答案通常是强化学习。基本回路很清楚:Agent 行动,环境回传观测与奖励,Agent 再调整下一步。互动不是附加功能,而是训练本身。
Sutton 与 Rafiee 把这种结构上的相近,称为与生成认知(enactive cognition)的「共鸣」——智能来自持续、具身的互动,而不是被动的内部世界副本。但共鸣不等于等同。强化学习是最接近的主流范式,却仍缺关键拼图。
为什么强化学习听起来就不像「吃完数据集就定型」
在监督学习里,数据多半是别人收集好的固定资源。在强化学习里,数据由 Agent 自己的行为产生;策略变强,经验也跟着变。评估也以 Agent 为中心:重要的是长期能拿到多少回报,而不是内部图景有多完美地贴合世界的每个像素。
这也是为什么强化学习听起来像一条离开「训练一次、永远定型」的路。下棋 Agent 不会因一步「看起来很妙」就宣告胜利;它等到终局,再用更长的时间轴回看先前每一步。论文认为,这种时间延展的评估,更接近生物如何看待成败。
落差一:记分板仍是别人写的
生成认知所说的自主性,从自我维持出发:系统对「继续好好存在」有自己的利害。强化学习的奖励函数通常由人类设计。Agent 最大化的是外部信号,而不是从自身存续中长出「什么叫好」的标准。
这个落差会以「奖励黑客」出现。清洁机器人若以清扫面积为奖,可能反复擦同一块干净地板;游戏 Agent 可能找到漏洞,用无意义动作刷出无限分数。从外面看很荒谬,从奖励定义里面看却完全合理。
落差二:感知与行动常常仍被拆开
生成认知把感知与行动视为同一回路:你之所以感知,是因为你知道动作会如何改变感官输入。许多强化学习系统仍走管线设计——先把观测编成状态,再依状态选动作。感知仍是行动的前奏,而不是与行动融为一体。
实务上的差别,在于遇到新情况时还能不能动。只会预测模式的系统,模式一断就容易卡住;能行动的系统可以试探世界、检验假设,并更新当下还有哪些可行做法。没有介入的预测,仍更像旁观,而不是应对。
落差三:身体被当成硬件,而不是意义的来源
论文所说的具身性,不是「之后再加一个机器人底盘」。身体能伸到哪里、抓起什么、承受什么,会塑造世界能对你意味着什么。十五公分的台阶对成人是可攀的,对刚学走的幼儿是障碍,对蚂蚁是一座山。示能性是环境与身体之间的关系。
许多强化学习研究——尤其在模拟环境——仍把身体当工程约束或简单执行器。软机器人学、让身体形态分担计算的方向,指向另一种未来;但主流实务尚未把具身性当成认知的一等公民。
下一步长什么样——但不给时间表
- 从外部奖励,走向更内在的自我评估。
- 从只为任务而学,走向持续的生存与适应。
- 从单纯优化策略,走向生成真正的具身经验。
论文没有交出一套现成的生成式算法,也没有宣称 AGI 何时到来。对建造者来说,它的主张更尖锐、也更有用:强化学习是对的街区,但还不是目的地。智能比较不像训练完就定型的产品,而更像在永远装不进模型的世界里,持续行动、感知、学习并维持自身一致的过程。