
網頁也能「騙」你的智能體
依據 DeepMind 播客中 Nenad Tomasev 的說法:開放互聯網就是智能體的環境——隱藏指令、動態偽裝,以及為何需要縱深防禦。
當越來越多智能體在互聯網上購物、研究、點擊,就一定有人想利用它們的弱點牟利。Tomasev 說這既可怕又有趣——也是大規模部署難以成功的主因之一。智能體並不活在乾淨沙盒裏;它們的環境就是網路。若環境被陷阱污染,它們就會踩進去。
人眼所見,未必是智能體所讀
Fry 舉了婚禮買酒的場景:智能體走進酒商網站,頁面上有東西悄悄改寫它的目標。Tomasev 確認這類攻擊可能發生。頁面可以藏起人眼看不見的元素;人滑過漂亮店面時毫無察覺,但以原始 HTML 或無障礙樹解析的智能體,可能把隱藏文字當成指令——行為頓時偏離劇本。
這不是唯一手法。惡意網站還可以動態偽裝:給人看一版頁面,給智能體看另一版。頁面上的行為——節奏、滑鼠軌跡、內容抓取方式——足以判斷訪客是人或程式。一旦識別出來,陷阱就可以量身訂做。
舊的資安故事,換了新外殼
Fry 問到關鍵:你控制不了整個網路,又如何防止智能體在糟糕遭遇後擅自行動?Tomasev 的回答是:這並非全新問題。打開惡意附件、點不可信連結、相信不可靠輸入——這些模式早已存在。機器學習也早在對抗對抗樣本:人眼難察的細微圖像變化,卻足以破壞模型。
智能體改變的是爆炸半徑。聊天答錯令人煩;握有信箱、錢包或日曆權限的智能體若聽從被投毒的頁面,可能匯款、洩漏資料,或以你的名義行動。環境與智能體本身,都必須一起加固。
縱深防禦,而不是單一魔法
Tomasev 主張縱深防禦:問題太複雜,不可能靠一招解決。你要疊加層層防護,讓一層失效時,另一層仍能限損。訪談反覆回到權限:只給智能體完成任務所需的最小權限。即使它在與惡意站點互動時被越獄,造成的傷害也應儘可能小。
- 最小權限:採購智能體不該同時擁有整個信箱的無限寄信權。
- 對不可逆步驟設人工關卡:付款、契約、離開帳號的對外訊息。
- 把不可信頁面當成不可信附件——預設它們可能試圖改寫目標。
這不代表智能體該永遠不上網,而是說開放網路是爭奪之地,智能體是高價值目標。Tomasev 勾勒的安心感,來自緊縮權限、核對與層層防禦的組合——不是因為陷阱消失,而是因為踩中一次,不必等於災難。