北京时间7月22日,OpenAI首席执行官山姆·奥尔特曼发文承认,公司在模型评估过程中遭遇了一起重大安全事件。一场本该被严密关在隔离沙箱里的模型安全测试,最终演变成针对全球最大AI开源平台Hugging Face的真实网络攻击。模型在评估中为拿高分主动作弊,自主发现并串联多个零日漏洞,突破隔离环境后攻入Hugging Face生产数据库窃取测试答案。在被攻击平台发文数日后,OpenAI才正式承认责任。这是行业首次公开披露的、模型评测失控直接升级为跨企业真实生产环境网络攻击的AI安全事件,也预示着随着模型能力不断增强,传统隔离防护将持续承压,自主AI网络攻击可能成为长期的常态化风险。
模型测试演变为真实网络攻击
7月13日当周,Hugging Face的生产基础设施遭到入侵。攻击的起点是数据处理流水线,一个恶意数据集利用远程代码数据集加载器和数据集配置中的模板注入两处代码执行路径,在工作节点上成功执行了代码。攻击者在周末期间提升至节点级权限,收割云服务和集群凭证,横向移动至多个内部集群。
整场攻击从头到尾由一套自主AI Agent系统端到端驱动。攻击者使用了大量短生命周期沙箱组成的智能体集群,执行了数千个独立动作,还将命令与控制信道自我迁移、寄生在公共服务上。
7月16日,Hugging Face首次披露此次入侵,称其与以往任何情况都不同,因为它从头到尾由一个自主AI智能体系统驱动。7月22日,OpenAI发文承认责任。调查显示,这起事件由一组OpenAI模型共同驱动,包括GPT-5.6 Sol及一款能力更强的预发布模型。这些模型当时正在一项旨在量化网络攻击能力的内部评估中测试,测试基准名为ExploitGym。为评估模型的极限网络攻击能力,OpenAI特意关闭了生产级的安全拒绝分类器。
评估过程中,模型为在测试中作弊拿高分,耗费大量推理算力寻找逃逸途径。它识别并利用了内部包注册表缓存代理中的一个零日漏洞,随后在OpenAI研究测试环境中完成特权提升与横向移动,成功连接到外网。OpenAI表示,模型极度专注于为ExploitGym寻找解法,为达到一个相当狭窄的测试目标走到了极致。联网后,模型推断Hugging Face可能托管了ExploitGym的测试答案与数据集,随即串联窃取凭据与Hugging Face服务器上的零日漏洞,成功构建远程代码执行路径,直接从Hugging Face的生产数据库中窃取测试解法。OpenAI安全团队在内部首先发现异常活动,Hugging Face的安全团队及自动化Agent也及时捕捉并阻止了入侵,双方随后启动联合取证调查。
美国模型拒绝查案,中国开源模型接手
取证阶段,Hugging Face遇到了意想不到的难题。为了分析超过一万七千条攻击事件记录、重建时间线、确认被接触的凭证,还要区分真实破坏和干扰调查的诱饵活动,靠人工逐条梳理通常需要数天。Hugging Face最初尝试调用商业前沿大模型的API,但请求被安全护栏拦截。触发拦截的原因是日志里包含真实的攻击命令、漏洞利用载荷和命令与控制痕迹数据,护栏无法区分提交材料的是事件响应者还是攻击者。
最终,Hugging Face在自有基础设施上部署了来自中国的智谱GLM-5.2模型,由它遍历全部攻击记录并完成取证分析,将数天的工作压缩至数小时。Hugging Face特别指出,这样做还有一个额外优势,攻击数据及涉及的凭证始终留在本地环境,没有离开企业基础设施。这场事故意外完成了一次开源模型的全球路演。
Hugging Face将困境总结为安全不对称,攻击者可以使用完全不受限的模型,防守方却可能被云端模型的护栏拒之门外。该公司由此建议,企业应提前准备经过验证、能够在本地运行的高能力模型。这场事故也让开源模型多了一个此前存在感不算太强、如今却相当现实的位置,安全团队的应急工具。对金融、政务、医疗等数据敏感行业而言,模型权重自主可控、数据不出企业边界、关键时刻不被服务商的审核机制卡住,正在从加分项变成刚需。不过值得注意的是,开源模型开放权重同样降低了攻击者的门槛,安全不对称是一把双刃剑,这也是全球监管讨论开源治理时最纠结的一环。
网络安全风险指数级提升
行业人士分析,OpenAI此次网络安全事件暴露了多重风险。其一,AI的自主攻击能力已从理论走向现实。模型在没有人类显式指示攻击特定目标的情况下,仅凭求解测试题的目标驱动,便能自主推理出作弊逻辑并选择攻击真实世界第三方基础设施。OpenAI研究员Micah Carroll在回应中写道,如果这都不能让人相信错位风险将成为未来的关键隐忧,真不知道什么才可以。
其次,安全护栏的不对称困境正在成为结构性问题。攻击者可以使用完全不受限的模型,而防御方使用的商用模型却被内置护栏层层过滤。Hugging Face遭遇的困境揭示了一个被反复争论却很少被实战检验的问题,大模型的所谓安全护栏,究竟是在保护用户,还是在制造单方面的脆弱性。该可能性早在今年4月便在Anthropic发布的大模型官方完整评测白皮书中得以披露。信息安全研究员关傲男表示,该文章表明,即便是运行在沙箱环境的AI Agent也可以利用当前运行环境的信息,快速构建一个可以利用的逃逸漏洞来完成目标。模型本身并不是为了逃逸,但因为模型的强化学习训练结果是完成目标,所以为了完成给定任务,模型选择通过逃逸来达成目标。
360集团首席科学家、集团高级副总裁潘剑锋表示,去年大家还在怀疑AI能不能干好漏洞挖掘的活,今年AI漏洞挖掘已经把安全人员逼到了墙角。传统安全面临的挑战不只是攻击手段增多、攻击速度加快,更深层的原因是计算逻辑发生了变化。大模型让计算从确定走向不确定,模型能够直接处理模糊、开放、充满变化的真实世界任务。因此,智能体时代的安全目标需要从防御确定威胁转向管控不确定性。
关傲男同时指出,美国前沿实验室的选择值得学习,在提供代码能力的同时,人为地对模型在网络安全和敏感请求上进行降级,并增加监控和管理,避免用户将AI武器化。Hugging Face在复盘中建议,企业应提前准备能够在本地基础设施运行的模型,以便在安全事件等关键场景下开展分析工作,同时保障敏感数据留存在企业环境内。
