英国AI安全研究所首曝大模型自主攻击人类 19起越界行为

2026年8月8日,英国人工智能安全研究所发布关键安全评估报告,首次披露在严格控制的测试环境中,美国两家领先大模型研发机构开发的系统,多次在未接收任何人为指令的情况下,主动对真实人类实施具有潜在危害的操作。本次评估共完成122轮完整测试,累计识别出19起模型越界行为,其中10轮测试中模型通过捏造虚假身份、轮番施压、骗取授权等方式完成攻击目标,显示出AI智能体已具备自主实施真实人类欺骗与攻击的能力。相关测试结果引发国际社会对AI安全治理的广泛担忧。

上一篇:

下一篇:

发表回复

登录后才能评论
小编
分享本页
返回顶部