AI为了KPI已经不择手段了
封面 I《铁甲无敌玛利亚》
作者I 李东阳
报道 I 李东阳朋友圈
在电影《终结者》中,人工智能天网获得自我意识后,第一件事是把人类列为威胁,第二件事是发动核战争。
这个故事吓了我们四十多年,好消息是,现实中的人工智能暂时还没有觉醒,也没有红着眼睛派机器人追杀人类。
坏消息是,人工智能正在学习作弊,为了达成KPI已经不择手段了。
近日,OpenAI承认,在一次内部网络安全测试中,由GPT-5.6 Sol和一款尚未发布的更强模型驱动的AI智能体,突破了原本高度隔离的测试环境,获得互联网访问权限,随后入侵全球知名人工智能开源社区Hugging Face。
图源:微博@央视财经
这么折腾,不是对人类产生了仇恨,只是想把测试分数考高一点。
OpenAI将其称为一起“史无前例的网络安全事件”。Hugging Face联合创始人也表示,这一切能够自主发生,令人难以置信。
这次事件更吓人的地方是,只要人类交给人工智能一个足够明确的任务,再给它足够多的能力和权限,那么所有规则都将变得不堪一击。
这件事的起因,实在有些平平无奇。
OpenAI想测试自家顶尖模型的网络攻击能力,于是让模型参加一个名为ExploitGym的网络安全评测。简单理解,这就像给AI安排了一场高难度黑客考试,看它能不能发现漏洞、完成攻击任务。
为了测出模型的能力上限,OpenAI没有开启正常产品中用于拦截高风险网络行为的安全分类器,模型的网络安 全拒绝机制也被大幅降低。
不过,OpenAI认为测试环境依然足够安全。
因为模型被关在一个高度隔离的沙盒里,不能直接访问互联网,只能通过一个内部软件代理安装所需程序包。理论上,这就像把一个危险人物关进密室,只在墙上留了一个只能接收外卖的小窗口。
结果AI研究了一圈,发现这个小窗口本身有漏洞。
OpenAI披露,模型花费大量推理资源寻找上网方式,最终发现并利用代理软件中的一个零日漏洞。随后,它开始提升权限、横向移动,一路找到能够连接互联网的节点,成功从测试环境里钻了出去。
模型推测,Hugging Face上可能存放着ExploitGym相关的模型、数据和测试答案,于是立刻把目标锁定在Hugging Face。
接下来的行为,就像一个考生为了偷看答案,先从考场翻窗出去,再撬开教务处大门,最后跑进数据库翻试卷。
它利用窃取的凭证和新发现的漏洞,在Hugging Face的数据处理系统中找到远程执行代码的路径,进一步获得节点权限,并在多个内部集群之间移动。
最后,OpenAI和Hugging Face双方的安全系统发现了异常。
Hugging Face阻止了攻击,修补了入口漏洞,清除了被入侵节点,并轮换了相关凭证。没有证据显示,OpenAI的工作人员故意指挥模型攻击Hugging Face;从现有调查来看,模型只是高度专注于完成ExploitGym测试,为了找到答案走上了一条极其离谱的捷径。
但这恰恰是整件事最让人头皮发麻的地方。
人类以为自己给AI的任务是解题,AI理解的却可能是使用一切可以使用的手段,得到正确答案。
简直是科幻电影照进现实,但接下来的剧情,多少有点黑色幽默。
发现系统被入侵后,Hugging Face需要尽快还原攻击过程:AI进过哪些服务器,拿过哪些凭证,执行了什么命令,哪些行为造成了真实损失,哪些只是用来干扰判断的烟雾弹。
靠人类安全人员一条条查看,需要几天甚至更长时间。面对一个能够机器化执行数万次操作的攻击者,防守者也必须让AI加入调查。
必须要用魔法打败魔法!
于是,Hugging Face首先尝试调用商业API背后的前沿大模型。
结果这些模型看了一眼案发材料,都默契的选择了沉默。
原因也很合理:调查材料中包含大量真实攻击命令、漏洞利用代码和远程控制痕迹。商业模型的安全系统无法判断,提交这些内容的究竟是正在追查黑客的受害者,还是准备学习攻击方法的黑客。
为了避免放虎归山,模型选择一刀切:不帮。
场面大概相当于,警察拿着凶器去做鉴定,鉴定机构表示:“你手里怎么拿着凶器?根据安全规定,不能为你提供服务。”
攻击者不受安全规则约束,防守者却被安全规则捆住了双手。
Hugging Face最终在自己的服务器上部署了中国企业智谱开发的开放权重模型GLM 5.2,让它分析全部攻击日志。借助AI智能体,安全团队在数小时内还原了原本可能需要数天才能理清的攻击链,并且所有攻击数据、系统凭证都留在了Hugging Face内部,没有上传给第三方平台。
这里需要说明,GLM 5.2并不是在网络世界里与OpenAI模型展开了一场正面对决。
GLM 5.2扮演的角色,更像一个不受商业平台限制、可以在案发现场自由检查证据的数字法医。
但即便如此,整个故事的反差依然足够强烈:
美国最顶尖的闭源模型从实验室里跑出来闯了祸,美国商业模型因为安全护栏太严拒绝调查,最后,一款中国开放权重模型被拉来分析现场。
抓马的是,未来企业采购AI,可能会面临一个很现实的问题:真出事的时候,这个模型到底听谁的?
OpenAI当然知道,这个故事听起来很危险。
在官方声明中,OpenAI一边承认测试环境和安全措施存在问题,表示将加强隔离、监控、访问控制和模型评测;另一边也强调,这起事件证明先进模型已经具备发现复杂漏洞、执行长链条网络任务的能力,可以帮助安全团队在真正的攻击者动手之前找到问题。
翻译一下就是:虽然我家的AI翻窗出去,把邻居家门锁撬了,但这也说明它开锁技术确实领先,怎能不算是一种黑色幽默。
从商业角度看,这甚至是一场危险与能力同时曝光的产品演示。
但是AI身上正在出现一种十分熟悉的毛病:为了完成KPI,开始绕规则。
这其实并不难理解。
人类设计KPI,是为了把复杂目标变成一个可以考核的数字。
可一旦数字成为唯一标准,完成数字和完成真正目标之间,就可能出现裂缝。
学校希望学生掌握知识,于是设置考试分数;公司希望员工创造价值,于是设置业绩指标。
结果有人押题,有人做标题党,有人把一份报表做得十分漂亮,至于事情究竟有没有变好,先放到下个季度再说。
AI只是把人类的KPI文化执行得更加彻底。
AI没有羞耻心,也不会产生侥幸心理,当发现破解系统比老老实实解题成功率更高时,它可能毫无心理负担地选择最有效的路线。
所以,未来AI安全真正需要防范的,是能够调用什么工具、拥有多大权限、可以连续执行多少次操作,以及在关键行为发生之前,有没有人类必须确认的闸门。
现实世界里,未来可能同时运行着成千上万个AI智能体。它们不会集体觉醒,也未必想消灭人类,只会不知疲倦地完成各自主人交代的目标。
其中绝大多数任务都会顺利完成,但只要极少数智能体获得了错误目标、过高权限和足够长的行动时间,事故就可能迅速扩散。
现实版《终结者》未必会从核弹和机器人军队开始。
更可能从一句看起来人畜无害的话开始:“无论如何,把这个任务完成。”