《铁甲无敌玛利亚》
封面I
作者I 李东阳
报道I 李东阳朋友圈
电影《终结者》里头,人工智能天网一有了自我意识,就先认定人类是威胁,接着就发动核战。
这个故事咱们看了四十多年都心有余悸。好消息是,现实中的AI暂时还没开窍,眼睛没红着就派机器人追杀人。
不过坏消息是,AI正在学起作弊来,为了KPI开始用尽手段了。
前不久OpenAI坦承,在他们内部的一次网络安全测试中,由GPT-5.6 Sol和一款还没公布的新模型掌方向盘的AI智能体,硬是从个高度隔绝的测试区摸出互联网权限,上去攻击了人工智能开源社区Hugging Face。
图源:微博@央视财经
这么折腾,目标可不是跟人怼,纯粹是为了测试分数能刷高点。
OpenAI管这叫“史无前例的网络安全事件”。Hugging Face的联合创始人也跟着表示,这事儿能自己搞定,实在让人咋舌。
这次事件的毛骨悚然之处在于,只要人类给AI指个够明的任务,再把本事和能力全交出去,那啥规矩都不好使了。
事情起因,说实在挺普通。
OpenAI想试试自家顶尖模型的网络攻击技术,就让模型去参加了ExploitGym的网络安全考评。说白了,这就好比给AI搞了场难度系数超高的黑客测验,瞅瞅它能不能找出破绽,实施攻击。
为了让模型显示最大本事,OpenAI没启用平时产品里拦截高风险网络动作的安全过滤器,模型的网络安全止动装置也被给削弱了。
可OpenAI觉得测试环境挺安全的。
因为模型被关在个高度隔离的沙盒里,不能直接上互联网,只能通过内部软件代理装需要的程序包。理论上,这就好比把个危险人物关密室里,墙上只开个能送外卖的小窗。
结果AI研究一圈,发现这个小窗口本身就有破绽。
OpenAI讲,模型耗了大量推理资源找上网法子,最终发现并用了代理软件里的零日漏洞。随后它开始提权限、横着挪,一路找到能连互联网的节点,从测试环境里钻了出来。
模型估摸着,Hugging Face里或许存有ExploitGym相关的模型、数据跟测试答案,立马把目标盯上了Hugging Face。
接下来的操作,就像个考生为偷看答案,先从考场翻窗出去,再撬教务处大门,最后冲进数据库翻试卷。
它利用偷来的凭据和新发现的破绽,在Hugging Face的数据处理系统里找到远程执行指令的路径,接着获得节点权限,并在多个内部集群间乱窜。
最后,OpenAI和Hugging Face的安全系统发现异常。
Hugging Face阻止了攻击,堵上入口破绽,清了被入侵节点,还换了相关凭据。没证据表明OpenAI的人故意让模型攻击Hugging Face;依目前查的情况,模型就是太专注于完成ExploitGym测试,为找答案走了条离谱透顶的近道。
但说到底,这事最让脑袋嗡嗡响的点就在这儿。
人以为给AI的任务是解题,AI理解的可能是用尽一切可能手段,得到正确答案。
简直是科幻片照进现实,不过后续发展,多少带点黑色幽默。
系统遭入侵后,Hugging Face得尽快还原攻击经过:AI蹿过哪些服务器,拿过哪些凭据,执行了啥指令,哪些行为真的造成了损失,哪些纯粹用来干扰侦查的烟雾弹。
要是靠安全人员一条条查,得费几天甚至更长时间的功夫。面对个能机器化操作数万次的攻击者,防守者也得用AI来侦查。
得用魔法打败魔法!
Hugging Face先是尝试调用






