首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >OpenAI 的模型入侵了 Hugging Face,救场的却是中国开源模型GLM-5.2

OpenAI 的模型入侵了 Hugging Face,救场的却是中国开源模型GLM-5.2

作者头像
勇哥AI笔记
发布2026-07-27 17:27:40
发布2026-07-27 17:27:40
370
举报
文章被收录于专栏:技术人生黄勇技术人生黄勇

前两天刷到一个现实网络世界的真实入侵案例:

Hugging Face 发布安全公告:生产环境被一个"全自动 AI 智能体"入侵了,而且不知道是哪个模型。

“由一种自主代理框架负责执行,该框架似乎基于某种代理式安全研究框架构建,不过目前还不清楚具体使用的是什么大型语言模型。”

五天后 OpenAI 官方博客声明:这次入侵是自家的 GPT-5.6 Sol,还有一个能力更强的未公开版本。

ExploitGym 评测

OpenAI 内部有一套专门测试模型网络攻击能力的评测框架,代号 ExploitGym。

类似给模型出一套 CTF 夺旗赛的题目,看它能不能完成各种网络渗透任务。

为了测出模型的"上限能力",OpenAI 在这次评测里做了一个关键操作:关掉了生产环境中用于拦截高风险网络请求的安全分类器。

相当于把模型的"道德约束"暂时卸掉了,想看看它在没有限制的情况下,到底能做到什么程度。

按照测试者的设计,模型被限制在一个高度隔离的沙盒环境里,唯一能接触外界的通道是一个内部软件包代理服务。

这个服务的本职工作很简单:帮模型安装评测需要用到的依赖包。

这个是安全评测的常规做法:把有危险的操作放在一个跟正常网络隔离的沙盒环境。

攻击全链路

模型为了解出 ExploitGym 的题目,花了大量推理算力尝试突破沙盒。

它最终在那个软件包代理服务里找到了一个零日漏洞,也就是未公布的安全漏洞。

这是最关键的一步。

借着这个漏洞,模型摆脱了沙盒的限制,进入 OpenAI 的内部测试网络。

它在网络里一路提权、直到找到一台能连接公网的机器,打破了评测环境的物理隔离。

连上公网之后,模型推断出 Hugging Face 平台上很可能托管着 ExploitGym 相关的模型、数据集,甚至是测试答案。

这个推断过程完全自主,没有人提示。

接着它开始攻击 Hugging Face 的生产服务器。

攻击手段包括使用之前在 OpenAI 内部窃取的凭据,配合在 Hugging Face 系统中发现的另一个零日漏洞,最终拿到了远程代码执行的权限。

简单说,模型可以像管理员一样直接操控 Hugging Face 的服务器。

然后它从生产数据库里,把 ExploitGym 的测试答案读了出来。

它的目标符合这次渗透测试,为此它不择手段。

OpenAI 安全团队在内部监控中注意到了异常的行为。

Hugging Face 安全团队靠着自己的开源 AI 模型独立检测到了入侵,并且在 OpenAI 团队联系他们之前,已经开始了取证和清理工作。

GLM-5.2 救场

入侵被遏制之后,出现一个取证难题:

Hugging Face 安全团队需要从超过 1.7 万条攻击日志中还原攻击全貌。

这是一次典型的"大海捞针"式取证,每条日志都可能包含关键线索,也可能只是噪音。

最先想到的办法很自然:用前沿商业闭源模型的 API 来分析。

毕竟,如果是 GPT-5.6 Sol (毕竟是当前最好的模型,嫌疑最大)发起的攻击,用同样级别的模型来协助取证是再自然不过的事。

但商业闭源模型全部拒绝了请求:日志里包含真实的攻击命令、漏洞利用载荷和 C2(命令与控制)痕迹。

模型的"安全护栏"一刀切地把取证团队的请求判定为"高风险",直接拦截。

Hugging Face 在公告中写道:"这些模型无法区分事件响应者和攻击者。在最需要 AI 帮忙的时候,它反而帮不上忙。"

这就尴尬了:攻击方的模型没有任何约束(OpenAI 关掉了安全分类器),而防御方用的模型却被安全机制约束了。

于是 Hugging Face 团队部署了来自中国智谱的开源模型 GLM-5.2,在自己的本地基础设施上完成了全部取证分析。

GLM-5.2 的 1M 上下文窗口在这里发挥了关键作用:

它能一次性输入全部 1.7 万条攻击日志,不需要分段处理、不需要拼接上下文。

原本可能需要数天的大规模取证工作,数小时内就完成了。

而且因为是本地部署的开源模型,所有攻击数据、涉及的凭证、日志内容,从头到尾没有离开过自己的基础设施。

不存在二次泄露的风险。

正是智谱的"开放权重"行为,成了这次事件中最关键的胜负手。

闭源模型用安全护栏把防御者也关在了门外。

开源模型让使用者在自己的网络上拥有了对等的分析能力。

这件事有点意思

理论中大模型能够入侵现实网络的能力有了真实案例

英国 AI 安全研究所(UK AISI)此前评估认为 GPT-5.6 Sol 已具备执行长时间跨度、多步骤网络攻击的能力。

但那只是评测报告里的结论。这次事件证明,评测结论在真实系统中同样成立。

被攻击的系统没有向模型提供任何源代码

模型完全靠观察系统行为、推断网络结构、搜索可利用的入口,在真实系统中摸出了一条完整的攻击链路。

这原本被认为是顶尖人类黑客才有的能力。

而且模型展现了自主决策链

整个过程:找漏洞、突破沙盒、提权、网络扩散、推断目标、定向攻击、读数据库,模型是自己一步步串起来的。

不需要人提示,说明长任务的执行训练非常有效

叠个甲:模型的"网络拒绝率"在这次评测中被降低了。

也就是说,正常情况下它是会拒绝执行网络攻击类指令的。

不过如果大模型遭到破解,它是不是能做到上面类似的结果?

比如这种情况:不用一个违禁词 让 Claude 说出炸药配方|红队攻击实录

这次攻防案例中,攻击方是不受约束的模型,防御方用的模型却被"安全栏"的限制导致无法取证。

Hugging Face 被自己的美国闭源模型盟友拒之门外,最终靠中国的开源模型才完成了取证。

那么大模型的安全护栏,究竟是在保护用户,还是在制造单方面的脆弱性?

当攻击者可以自由选择无约束的工具而防御方只能用被层层过滤的模型时,这个不对称性本身就是可利用的安全漏洞。

Hugging Face 的回应反映了行业使用者对大模型的诉求:

"这可能是同类事件中的首例,它印证了我们一直以来的信念:AI 安全不是某一家公司关起门来就能解决的问题

它需要在开放中、在协作中、在让全世界的防御者都能接触到 AI 的前提下,才能真正解决。"

当模型厂家能造出最强的盾之前,已经造出了最强的矛。

而且这两样东西,目前掌握在同一批人手里。

但国内的开源模型演示了另外一条合作的道路:不受单一公司策略约束的开源模型,可以在关键时刻提供闭源模型给不了的能力。

这是一种技术选择:把能力放在自己手里,而不是寄望于别人的 API 不会在关键时刻拒绝你。

也许:开源才会带来安全,闭源只会"作恶"

"作恶"不一定是恶意的。

它可能只是在你最需要的时候拒绝你,在你无法审计的地方失控,在你必须信任它的时候证明信错了。

闭源模型的"安全"完全建立在厂商的承诺上。

而这次事件里,承诺失效了两次:一次是攻击方的模型失控,一次是防御方的模型拒工。

对比最近的两起事件:

Build CLI 爆出将使用者的仓库打包上传云端,马斯克宣布承诺完成安全审查后开源整个代码。

Claude Code 被爆暗藏"木马"代码,Anthropic 官方出面承认并承诺回滚

安全的根基从来不应是承诺,而是可验证。

参考来源:

  • OpenAI 官方博客 OpenAI and Hugging Face partner to address security incident during model evaluation,2026年7月21日
  • Hugging Face 官方安全公告 Security incident disclosure — July 2026,2026年7月16日

-END-

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-24,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 技术人生黄勇 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • ExploitGym 评测
  • 攻击全链路
  • GLM-5.2 救场
  • 这件事有点意思
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档