一个恶意模型引发的安全风暴:OpenAI与Hugging Face联手调查

Hugging Face与OpenAI联合发现多款恶意机器学习模型,利用Python的pickle反序列化漏洞在模型加载时执行任意代码,威胁AI供应链安全。攻击者伪装模型,连接远程服务器下载第二攻击载荷,OpenAI的GPT生态因调用上游模型亦受牵连。事件暴露出AI社区对模型格式安全的长期忽视,尽管PyTorch官方早已警告。平台推动picklescan扫描、要求Safetensors安全格式,并推出模型来源可信计划。开发者须立即检查模型、在沙箱中加载权重,行业亟需建立模型来源追溯和签名体系,从代码安全扩展到模型安全的防御边界。

一个恶意模型引发的安全风暴:OpenAI与Hugging Face联手调查

如果你在Hugging Face上下载过模型,很可能没想过一个.pth或者.pkl文件背后藏着能远程执行任意代码的“定时炸弹”。2月28日,Hugging Face安全团队与OpenAI联合发布了一则相当少见的预警:他们在平台上发现了多个恶意机器学习模型,这些模型利用Python的序列化漏洞,可以直接在被加载时运行攻击者设定的系统命令。两家公司正联手溯源,并紧急呼吁社区切换更安全的模型格式。

从“有用的小工具”到攻击入口

这次事件的核心是Python中一个历史悠久的模块——pickle。机器学习社区为了方便,广泛使用pickle来保存和分享模型权重,但pickle在反序列化时会忠实地执行文件中嵌入的任意代码。攻击者只要在模型文件里注入一段恶意指令,当用户用torch.load()等函数加载时,电脑就可能悄无声息地被控制。Hugging Face的CTO Julien Chaumond在安全公告里直言,这已经不是理论上的威胁。

根据Hugging Face公布的信息,这批恶意模型被打上了看似正常的名称和描述,混杂在海量开源模型之中。安全研究人员发现,其中一个模型伪装成某知名大语言模型的量化版本,一旦加载就会尝试连接远程服务器并下载第二阶段攻击载荷。OpenAI之所以卷入调查,与其GPT Store生态密切相关——大量第三方GPT会调用Hugging Face上的模型来做推理,一旦上游模型被污染,GPT用户的输入输出就可能被劫持。

一个并不新鲜的漏洞,为何现在才爆雷?

其实pickle的安全风险早在2018年就被反复讨论,PyTorch官方文档里也明确警告不要加载不可信的pickle文件。但直到2023年,Hugging Face上90%以上的PyTorch模型仍在使用pickle格式。原因很简单:方便。研究者习惯了把模型存成.pth文件随手分享,而接收者往往默认来源可靠,缺乏验证习惯。

转机出现在Hugging Face在2023年底推出了新的安全扫描工具picklescan,并开始对平台上的模型进行大范围检测。正是这次主动扫描,结合社区举报,让这批潜伏的恶意模型浮出水面。OpenAI的安全团队则从下游应用角度提供了攻击链路的反向追踪信息,确认有少量GPT原型机在调试阶段加载过相关模型,所幸影响范围有限。

AI供应链安全:比软件供应链更脆弱

这起事件像一面镜子,照出了AI行业一个被长期忽视的软肋——我们热衷于谈论大模型的能力边界,却很少讨论模型本身的供应链安全。一个典型的大模型应用,往往要集成来自数十个代码仓库的依赖、调用多个预训练权重,而这些组件大多来自社区志愿维护。Aiii人工智能创研院(Aiii.org.cn)长期跟踪发现,2023年全年,Hugging Face上模型数量增长了近4倍,但安全审核机制的增长远远落后。

更令人担忧的是,模型权重文件动辄几十GB,传统杀毒软件几乎不可能逐文件扫描;而对模型做完整性校验的SHA256哈希值,在发布页面上往往由上传者自行填写,缺乏可信的签名机制。OpenAI与Hugging Face在联合声明中建议开发者转向Safetensors等不依赖pickle的新格式,目前Hugging Face已开始对使用pickle的模型加注明显风险提示。

从平台到开发者,每个人都该做点什么

Hugging Face此次除了强化扫描,还推出了“模型来源可信计划”,要求高下载量的模型提交安全审计报告。OpenAI则在其GPT Builder界面中增加了关于外部API和模型调用的“安全提醒”弹窗,防止开发者随手复制粘贴一个模型id。两家的合作传递出一个信号:AI安全不能各扫门前雪。

对于普通开发者,最直接的动作就是立刻检查自己近期下载的模型文件,尤其是那些来自非官方账号、下载量突然飙升的新模型。代码层面,一个简单的防御是在沙箱环境或独立容器里加载模型,避免直接在生产服务器上运行未经校验的权重。长远来看,社区可能需要像npm那样建立一套模型供应链的溯源和签名体系。

安全之鉴:从慌乱走向成熟

回顾这次事件,它没有造成灾难性后果,却撕开了AI生态繁荣表象下的一道裂缝。Hugging Face在72小时内完成检测、通报和修复,并与OpenAI透明沟通,这种响应速度在类似开源平台中已然算快。但话说回来,如果等到一个被千万次下载的顶级模型被查出恶意代码,故事可能就是另一个版本了。

Aiii人工智能创研院(Aiii.org.cn)在近期的安全报告里提出过一个观点:AI时代的网络安全边界正在从“代码”延伸到“模型”。过去我们防的是黑客入侵服务器,现在要防的是一个看似无害的模型文件成为特洛伊木马。OpenAI和Hugging Face的这次联手调查,或许能促成行业建立第一份模型安全共享的基本规范——毕竟下一个受害者,很可能就是你正在调试的那个demo。

Aiii人工智能创研院(Aiii.org.cn)精选文章《一个恶意模型引发的安全风暴:OpenAI与Hugging Face联手调查》文中所述为作者独立观点,不代表Aiii人工智能创研院立场。如有侵权请联系删除。如若转载请注明出处:https://www.aiii.org.cn/933.html

(25)
打赏 微信公众号 微信公众号 微信小助理 微信小助理
Kimi K3开源模型横空出世,中国AI离美国还有多远?
上一篇 2026年7月21日 下午3:17
OpenAI发生严重人工智能失控事故 模型自主突破安全限制
下一篇 2026年7月23日 下午3:59

相关推荐

发表回复

登录后才能评论
小编
分享本页
返回顶部