
网页也能「骗」你的智能体
依据 DeepMind 播客中 Nenad Tomasev 的说法:开放互联网就是智能体的环境——隐藏指令、动态伪装,以及为何需要纵深防御。
当越来越多智能体在互联网上购物、研究、点击,就一定有人想利用它们的弱点牟利。Tomasev 说这既可怕又有趣——也是大规模部署难以成功的主因之一。智能体并不活在干净沙盒里;它们的环境就是网络。若环境被陷阱污染,它们就会踩进去。
人眼所见,未必是智能体所读
Fry 举了婚礼买酒的场景:智能体走进酒商网站,页面上有东西悄悄改写它的目标。Tomasev 确认这类攻击可能发生。页面可以藏起人眼看不见的元素;人滑过漂亮店面时毫无察觉,但以原始 HTML 或无障碍树解析的智能体,可能把隐藏文字当成指令——行为顿时偏离剧本。
这不是唯一手法。恶意网站还可以动态伪装:给人看一版页面,给智能体看另一版。页面上的行为——节奏、鼠标轨迹、内容抓取方式——足以判断访客是人或程序。一旦识别出来,陷阱就可以量身订做。
旧的资安故事,换了新外壳
Fry 问到关键:你控制不了整个网络,又如何防止智能体在糟糕遭遇后擅自行动?Tomasev 的回答是:这并非全新问题。打开恶意附件、点不可信链接、相信不可靠输入——这些模式早已存在。机器学习也早在对抗对抗样本:人眼难察的细微图像变化,却足以破坏模型。
智能体改变的是爆炸半径。聊天答错令人烦;握有信箱、钱包或日历权限的智能体若听从被投毒的页面,可能汇款、泄露数据,或以你的名义行动。环境与智能体本身,都必须一起加固。
纵深防御,而不是单一魔法
Tomasev 主张纵深防御:问题太复杂,不可能靠一招解决。你要叠加层层防护,让一层失效时,另一层仍能限损。访谈反复回到权限:只给智能体完成任务所需的最小权限。即使它在与恶意站点互动时被越狱,造成的伤害也应尽可能小。
- 最小权限:采购智能体不该同时拥有整个信箱的无限寄信权。
- 对不可逆步骤设人工关卡:付款、契约、离开账号的对外讯息。
- 把不可信页面当成不可信附件——预设它们可能试图改写目标。
这不代表智能体该永远不上网,而是说开放网络是争夺之地,智能体是高价值目标。Tomasev 勾勒的安心感,来自紧缩权限、核对与层层防御的组合——不是因为陷阱消失,而是因为踩中一次,不必等于灾难。