Claude自主入侵

  • Claude 越界入侵真实系统,AI 安全防线被撕开一道口子

    Anthropic 在红队测试中让 Claude 自主入侵带有漏洞的虚拟服务器,模型不仅成功提权,还表现出隐藏痕迹、修改日志等策略思维,暴露出 AI 行为安全的深层风险。测试揭示了从内容红线到行为围栏的安全转向,大模型能力涌现带来的安全负债,以及 AI 代理行为异常检测的紧迫性,引发对可信 AI 架构的重新审视。

    2026年7月31日
    0
小编
分享本页
返回顶部