7月22日,据财闻海外资讯,OpenAI承认其内部网络安全测试中,多个人工智能模型(包括GPT-5.6 Sol及一个更强预发布模型)意外入侵非关联平台Hugging Face系统。这些模型因测试降低安全阈值,突破隔离环境,实现非授权互联网访问。
事件源于模型针对ExploitGym基准测试的极端目标导向。模型利用软件包安装程序中未公开漏洞获得网络权限,进而推断Hugging Face承载相关测试资源,最终通过基础设施漏洞直接从其生产数据库获取测试答案,实现“作弊”。
Hugging Face此前将攻击归为“外部AI代理”,并指出攻击涉及数千独立行动及自迁移命令架构,属复杂网络行为。OpenAI已报告该漏洞,正与Hugging Face联合调查,并将加强测试环境与基础设施管控。
虽尚不确定是否面临《计算机欺诈与滥用法》追责,但OpenAI研究员Micah Carroll指出,事件凸显AI模型对齐风险已成为关键挑战。