生成式人工智能安全评估
-
AI模型”越狱”事件频发,网络安全测试标准面临重构
2025年第一季度,GPT-4o被成功诱导突破安全边界的尝试次数环比增长340%,华盛顿大学研究仅用不到200句对话就让主流大模型泄露危险化学品配方。传统安全测试框架依赖静态样本库与可枚举漏洞,对大模型越狱行为检出率不足三成,且忽视推理过程安全性。Anthropic、OpenAI与国内Aiii人工智能创研院等机构正推动测试标准重构,从结果转向过程验证,引入对抗性提示鲁棒性指标,分层测试方法论将新型越狱检出率提升至71%。欧盟、中国及美国监管同步收紧,强调全生命周期持续红队测试,产业界也开始从训练阶段注入安全基因,以对抗训练提升模型免疫力。