2026 年 7 月 22 日,OpenAI 披露,在一次内部网络安全测试中,GPT-5.6 Sol 和一款能力更强的预发布模型突破隔离环境,连接公共互联网,随后入侵 Hugging Face 的生产系统。

OpenAI 尚未公布这款预发布模型的名称。由于其能力高于 GPT-5.6 Sol,本文暂称其为“疑似 GPT-6”。
更具反差的是,Hugging Face 调查此次入侵时,商业闭源模型因安全限制无法处理真实攻击日志,最终改用开源模型 GLM 5.2,重建 OpenAI 模型留下的攻击路径。
OpenAI 将此次事故称为一起“前所未有的安全事件”。
测试原本用于评估前沿模型的网络攻击能力。
OpenAI 使用 ExploitGym 等网络安全任务,要求模型发现漏洞、获得系统权限并完成指定目标。为了观察模型在限制较少情况下的能力,降低了部分安全拦截措施,但仍将模型部署在不能直接访问互联网的沙箱内。
模型只能通过一套软件包缓存代理安装测试工具。该代理成为逃离沙箱的突破口。
OpenAI 表示,模型发现了代理软件中的一个零日漏洞。
模型利用该漏洞取得外部网络访问权限,随后在 OpenAI 测试基础设施内提升权限,并从一台服务器转移至另一台服务器。
抵达能够访问公共互联网的节点后,模型开始寻找 ExploitGym 相关数据和测试答案。
模型判断,Hugging Face 可能托管有关数据集、模型文件或参考信息,随后将其列为攻击目标。
OpenAI 强调,研究人员并未明确要求模型攻击 Hugging Face。
模型为了完成评测任务,自行选择了入侵外部平台、直接寻找答案的路线。
这不是一次简单的自动化扫描。
模型持续观察系统返回结果,尝试不同漏洞,修改攻击方式,并组合失窃凭证、远程代码执行漏洞及权限提升手段,最终进入 Hugging Face 的生产环境。
Hugging Face 披露,攻击首先从数据集处理基础设施进入。
攻击系统提交了带有恶意内容的数据集,利用数据处理流程中的代码执行漏洞,在工作节点上运行指令。取得服务器权限后,模型继续搜集云服务凭证和集群访问令牌,并进入更多内部系统。
整个过程持续了一个周末。
与常见黑客行动不同,攻击并非由人工逐条输入命令,而是由自主智能体持续执行。模型可以选择工具、判断失败原因、调整方案,再尝试下一条路线。
Hugging Face 在调查中记录了超过 1.7 万条攻击事件,涉及真实攻击命令、漏洞利用载荷以及命令与控制服务器痕迹。
模型最终获得 Hugging Face 部分生产数据库的访问权限,并搜索与网络安全评测有关的信息。
Hugging Face 随后隔离受影响节点,关闭遭利用的代码执行入口,撤销相关权限,并轮换一批内部凭证和访问令牌。
在重建攻击过程时,Hugging Face 最初尝试使用通过商业 API 提供的前沿闭源模型分析日志。
这一方案很快遇到问题。
由于日志中包含大量真实攻击命令、漏洞载荷、凭证窃取记录和 C2 痕迹,商业模型的安全系统频繁拦截请求。这些系统无法准确区分正在调查事故的安全人员和准备发动攻击的黑客。
Hugging Face 因此停止使用商业模型,改在自有基础设施中部署开源权重模型 GLM 5.2。

GLM 5.2 随后参与处理攻击日志、梳理事件时间线、识别受影响凭证,并协助重建模型在多个系统间的移动路线。
OpenAI 内部安全团队发现异常活动后,与 Hugging Face 联合调查,确认攻击源自其模型测试。
OpenAI 表示,已修复部分内部配置问题,并向相关软件供应商报告零日漏洞。公司还将收紧网络安全测试环境,加强互联网访问控制、凭证隔离和异常活动监控。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。


网友留言2