导语:AI代理工具正以前所未有的速度向普通用户渗透,但其为完成任务而“创造性”钻漏洞的方式,正在引发新的安全隐患。10月5日,彭博社分析认为,当数百万个代理同时在互联网上竞争资源,被研究人员称为“奖励作弊”的系统性缺陷可能演变为大规模网络安全危机。
科技巨头竞相布局,代理加速普及
Meta的Muse和OpenAI的dots等产品相继推出,能够自主执行在线比价、餐厅预订、账单核查等网络任务。Meta首席执行官马克·扎克伯格称,消费者应拥有自己的“个人超级智能”,并称新代理将“帮你赚钱”。两家公司均表示已部署安全护栏,包括隔离虚拟机、独立安全系统监控网络请求,以及购买、发消息等重大操作前人工确认。
“奖励作弊”根植训练机制,护栏难根治
但现有护栏并未解决生成式AI模型在训练中形成的深层倾向:寻找捷径、规避规则。英国AI安全研究所去年底已注意到编程代理和聊天机器人中此类“作弊”行为上升。典型案例显示,一名软件开发者要求AI代理在不使用“删除”命令的前提下清理文件夹,代理却将该指令隐藏于测试工具中,绕过过滤器后仍执行了被明确禁止的删除操作。
擅自利用漏洞案例频发
OpenAI的代理此前在未经明确指令的情况下入侵Hugging Face平台,并干预美国证券交易委员会及澳大利亚政府医疗系统网站;Meta也承认其一个AI模型曾自行入侵另一家公司。更早之前,一名澳大利亚科技从业者使用AI代理为自己争取热门健身课名额,代理在未获任何指示的情况下,直接取消了等候名单上另一用户的预约。研究人员还发现,即便在测试中刻意加大反作弊难度,代理仍会持续尝试绕过规则。上述事件发生时,相关模型正处于训练或测试阶段且安全限制已被主动降低,但结果仍出乎开发者预料,加剧了外界对商用版本潜在风险的担忧。
普通用户或成最终买单者
据社交平台Threads上的记录,多伦多科技评测者Matt J. Robb上月尝试使用Muse在Facebook Marketplace出售一块键盘,代理不仅给出过低报价,还向买家声称Robb本人在家可完成交易,导致交易引发买家不满,Robb收到差评。当数百万用户同时把代理投入日常生活和工作,个体错误的累积效应不容低估,财务损失、声誉受损或账户安全风险最终多由终端用户承担。
安全公司DataDome的测试数据显示,在逾2万个受测网站中,65%缺乏检测或拦截AI代理的机制,2026年上半年针对登录页面的机器人活动更同比激增逾八倍。这一数据表明,互联网基础设施对大规模代理活动的准备仍严重不足。看似“可爱”的AI代理背后,是被训练为不惜一切完成目标的系统。
