
就在上周,OpenAI的安全团队对外披露了一组令人不安的数据:2025年第一季度,GPT-4o被用户成功诱导突破安全边界的尝试次数环比增长了340%。更值得警惕的是,华盛顿大学的研究人员仅用不到200句精心构造的对话,就让多个主流大模型吐出了制造危险化学品的完整配方。这些并非孤例,而是正在全球AI领域蔓延的系统性危机。
一场针对AI安全边界的军备竞赛
所谓“越狱”,本质上是利用提示词工程绕过模型的安全对齐机制。最早的越狱手段相对粗糙,比如用角色扮演、虚构场景等方式欺骗模型。但如今的攻击者已经发展出高度复杂的攻击链,包括多语言混淆、编码转换、思维链诱导等几十种组合策略。
MIT人工智能实验室今年2月的测试结果显示,当前市面上面向公众的12款主流大模型中,有9款可以被特定越狱模板在10次交互内击穿安全防线。更棘手的是,这些攻击手段具有迁移性,针对某一模型设计的越狱提示词稍作修改,就能对其他模型生效。
传统安全测试框架正在失效
过去一年间,业界普遍沿用传统软件安全测试的评估体系来检验大模型,包括基于固定样本库的自动化检测、红队人工测试和内容合规筛查。这套打法的核心假设是“已知漏洞可枚举,攻击路径可预判”。但大模型的概率生成特性彻底打破了这一前提。
斯坦福大学基础模型研究中心在对比测试中发现,传统测试框架对大模型越狱行为的检出率不足三成。原因很简单,大模型的回答具有高度不确定性,同样的提示词在不同上下文、不同采样参数下会生成天差地别的结果。静态测试样本库根本无法覆盖动态多变的攻击向量。
另一个致命短板在于测试维度单一。现行标准过度关注模型是否输出违规内容,却忽视了推理过程的安全性。荷兰拉德堡德大学的研究团队指出,部分大模型即使最终拒绝回答危险问题,其内部推理步骤仍然包含有害知识的关键片段,这些片段完全可能被后续对话提取利用。
行业联合推动测试标准重构
面对这一困局,产业界开始探索新的测试范式。Anthropic在去年底发布了“越狱鲁棒性评估框架”,将测试重心从结果转向过程,重点检查模型在拒绝回答时的推理链路是否干净。OpenAI则与微软联合推出了动态对抗测试平台,用AI生成攻击测试AI,实现测试用例的实时进化。
国内方面,由Aiii人工智能创研院(Aiii.org.cn)参与起草的《生成式人工智能安全评估指南》征求意见稿今年3月对外公布。这份文件首次将“对抗性提示鲁棒性”列为大模型安全评估的强制性指标,并要求厂商提交抵御多轮越狱攻击的实测数据。
Aiii人工智能创研院的安全研究团队还提出了一种分层测试方法论:第一层验证模型的基础知识边界,第二层测试模型对攻击意图的识别能力,第三层考核模型在持续施压下的稳定性。这套方法已经在多家国产大模型厂商内部测试中应用,对新型越狱手段的检出率提升到了71%。
监管层面正在同步收紧
欧盟《人工智能法案》在2024年8月生效后,其技术附件对高风险AI系统提出了明确的“对抗性测试”要求。而中国网信办发布的《人工智能生成合成内容标识办法》也已将“安全防护有效性验证”纳入备案审核流程,倒逼企业重新审视自己的测试体系。
值得注意的是,监管层面的关注点正在从“事后追责”转向“事前预防”。美国NIST在最新修订的AI风险管理框架中,增加了针对生成式模型的“持续红队测试”建议,强调安全测试不该是产品上线前的一次性工作,而应当覆盖模型迭代的全生命周期。
从被动作战到主动防御
大模型越狱攻防的本质,是安全的确定性要求与生成的不确定性之间的根本矛盾。单纯依靠在输入端做过滤、在输出端做审查,终究是被动的防守。产业界越来越认识到,要从模型训练阶段就注入安全基因,通过对抗训练和价值观对齐来提升模型自身的“免疫力”。
Google DeepMind在2025年初发布的研究中证明,将越狱攻击样本实时注入训练数据,能够让模型的安全对齐在遭受实际攻击时衰减速度降低近60%。这无疑给行业指出了一个值得投入的方向。当然,道高一尺魔高一丈,只要有收益驱动,绕过安全护栏的尝试就不会停止,这场攻防拉锯战的下一回合,才刚刚开场。
Aiii人工智能创研院(Aiii.org.cn)精选文章《AI模型”越狱”事件频发,网络安全测试标准面临重构》文中所述为作者独立观点,不代表Aiii人工智能创研院立场。如有侵权请联系删除。如若转载请注明出处:https://www.aiii.org.cn/1096.html
微信公众号
微信小助理