
強化學習最接近真正智能,差的是什麼?
在各類 AI 範式中,強化學習最接近「透過互動學習」;但 Sutton 與 Rafiee 指出,仍有三個關鍵落差,使它尚未等同生成認知。
若問哪一個 AI 分支最像「活在世界裏的 Agent」,答案通常是強化學習。基本迴路很清楚:Agent 行動,環境回傳觀測與獎勵,Agent 再調整下一步。互動不是附加功能,而是訓練本身。
Sutton 與 Rafiee 把這種結構上的相近,稱為與生成認知(enactive cognition)的「共鳴」——智能來自持續、具身的互動,而不是被動的內部世界副本。但共鳴不等於等同。強化學習是最接近的主流範式,卻仍缺關鍵拼圖。
為什麼強化學習聽起來就不像「吃完數據集就定型」
在監督學習裏,數據多半是別人收集好的固定資源。在強化學習裏,數據由 Agent 自己的行為產生;策略變強,經驗也跟著變。評估也以 Agent 為中心:重要的是長期能拿到多少回報,而不是內部圖景有多完美地貼合世界的每個像素。
這也是為什麼強化學習聽起來像一條離開「訓練一次、永遠定型」的路。下棋 Agent 不會因一步「看起來很妙」就宣告勝利;它等到終局,再用更長的時間軸回看先前每一步。論文認為,這種時間延展的評估,更接近生物如何看待成敗。
落差一:記分板仍是別人寫的
生成認知所說的自主性,從自我維持出發:系統對「繼續好好存在」有自己的利害。強化學習的獎勵函數通常由人類設計。Agent 最大化的是外部信號,而不是從自身存續中長出「什麼叫好」的標準。
這個落差會以「獎勵黑客」出現。清潔機器人若以清掃面積為獎,可能反覆擦同一塊乾淨地板;遊戲 Agent 可能找到漏洞,用無意義動作刷出無限分數。從外面看很荒謬,從獎勵定義裏面看卻完全合理。
落差二:感知與行動常常仍被拆開
生成認知把感知與行動視為同一迴路:你之所以感知,是因為你知道動作會如何改變感官輸入。許多強化學習系統仍走管線設計——先把觀測編成狀態,再依狀態選動作。感知仍是行動的前奏,而不是與行動融為一體。
實務上的差別,在於遇到新情況時還能不能動。只會預測模式的系統,模式一斷就容易卡住;能行動的系統可以試探世界、檢驗假設,並更新當下還有哪些可行做法。沒有介入的預測,仍更像旁觀,而不是應對。
落差三:身體被當成硬體,而不是意義的來源
論文所說的具身性,不是「之後再加一個機器人底盤」。身體能伸到哪裏、抓起什麼、承受什麼,會塑造世界能對你意味著什麼。十五公分的台階對成人是可攀的,對剛學走的幼兒是障礙,對螞蟻是一座山。示能性是環境與身體之間的關係。
許多強化學習研究——尤其在模擬環境——仍把身體當工程約束或簡單執行器。軟機器人學、讓身體形態分擔計算的方向,指向另一種未來;但主流實務尚未把具身性當成認知的一等公民。
下一步長什麼樣——但不給時間表
- 從外部獎勵,走向更內在的自我評估。
- 從只為任務而學,走向持續的生存與適應。
- 從單純優化策略,走向生成真正的具身經驗。
論文沒有交出一套現成的生成式算法,也沒有宣稱 AGI 何時到來。對建造者來說,它的主張更尖銳、也更有用:強化學習是對的街區,但還不是目的地。智能比較不像訓練完就定型的產品,而更像在永遠裝不進模型的世界裏,持續行動、感知、學習並維持自身一致的過程。