红队测试
-
AI大模型越狱攻防战:当安全护栏成为新战场
大模型越狱攻防战正从偶然发现演变为系统性对抗。自动生成攻击模板的DeGC方法、多轮诱导的Crescendo攻击,让传统防护机制失效。腾讯朱雀实验室、阿里、百度等厂商加大红队测试投入,瑞莱智慧等安全厂商推出“愚公”评测平台,主动寻找漏洞成为行业共识。但过度防御也带来误判频发、用户体验下降等副作用,安全与智能的平衡成为关键课题。越狱工具的滥用还催生深度伪造风险,监管政策同步收紧。业内普遍认为,大模型安全攻防没有终点,安全性、可用性与透明度的均衡,将决定谁能赢得用户长期信任。