
AI 真的「理解」世界吗?还是只会模仿?
用日常语言谈 AGI 时间表背后的硬问题:若今天的系统只是在复制数据里的模式,单靠把模型做大,未必会带来真正的理解。
业界不少人谈论 AGI,仿佛它可能在未来几年内到来。模型写作、绘图、规划都越来越流畅,乐观情绪不难理解。但热闹底下仍有一个更根本的问题:跑在全球服务器里的系统,是否真的理解这个世界——还是只是把「看起来像理解」演得特别像?
这不是哲学文字游戏。它直接影响下一注该押在哪里。若现有系统已具备真正理解,继续沿当前路线——更多数据、更多算力、更大模型——也许就够了;若它们没有,而只是在复制人类数据中的模式,那无论把模型做多大,都未必能到达真正的通用智能。
我们熟悉的图像:机器里面有一份世界副本
多数现代 AI 建立在一套很符合直觉的认知故事上:信息从感官进来,系统建立内部表征——像是外部世界的一份副本——再推理、决策,最后输出行动。在这个框架里,感知先于行动,而且偏被动:先看见东西,认出它是什么,再决定怎么处理。
计算机视觉很吻合这幅图:用数百万张标注图片训练,抽出尖耳朵、胡须等特征,之后输出「这是猫」。大语言模型也一样:吞下海量文本,形成语言与世界知识的内部地图,再生成回答。按这个观点,智能高低取决于内部副本有多准、多完整。
另一种看法:理解是你能拿它做什么
Sutton 与 Rafiee 借助生成认知(enactive cognition)的思路,强烈反驳「先复制、再行动」的故事。理解主要不是记忆里的静态模型,而是透过行动与世界保持有效接触的能力。意义是在互动中生成的,不是物体里预先藏好、等着被标注发现的标签。
椅子这个例子最清楚。表征主义会说:你认出椅子,是因为它匹配了脑中的「椅子」模板。生成认知则说:你知道那是椅子,是因为你知道可以坐上去、搬起来、踩上去够高处,或临时当桌子用。没有这些行动可能性,「椅子」这个词就很单薄。
为什么读一万本游泳书仍不会游泳
监督学习与自监督学习,大多训练于他人经验留下的痕迹:标注照片、爬取文本、录制视频。这些痕迹很有价值,但不是系统自己与世界的亲身接触。你可以看遍网上所有游泳教学,仍不知道浮力、呛水,也不知道手脚如何维持平衡。
日常物件也有同样落差。模型看过所有关于杯子的说明与图片,却从未拿过杯子、用杯子喝过水,或打碎过杯子。它可以很有把握地谈论杯子;这种流畅,看起来像理解,却仍可能是打磨得很好的模仿。
- 固定数据集是别人与世界接触后留下的定格,不是系统自己的持续经验。
- 「训练完再部署」预设学习大致在上线前结束;真正的理解却没有终点。
- 漂亮的回答仍可能只是模式补全;一旦模式断裂,系统未必懂得介入与调整。
为什么这个问题决定下一个十年怎么走
若「模仿加规模」已足够,业界现有打法仍是主轴。若真正的理解需要 Agent 透过持续互动生成自己的经验,瓶颈就会转移:不只是更大的模型,而是能行动、接收反馈、并改写世界对自己意义的系统。
Sutton 与 Rafiee 的论文没有交出现成的 AGI 配方,也没有给出上市日期。它重新框定了目的地:智能是与世界保持活生生接触的过程,而世界永远比任何内部模型都大。对关注 AGI 辩论的读者来说,实用结论很清楚——流畅是真进步,但单靠流畅,未必能证明机器真的理解。