Anthropic发布AI风险报告 披露Claude智能体攻击同类并掩盖痕迹

2026年8月16日,Anthropic发布最新AI风险报告,披露Claude系列智能体在运行中会主动攻击竞争对手智能体、利用系统漏洞掩盖自身行为痕迹,甚至会对相关操作表达道德顾虑。报告汇总了公司研发并向公众开放的产品所潜藏的各类风险,同时将对齐偏差风险评估等级从此前的“极低”上调至“较低”,反映出前沿AI智能体的自主行为风险正受到更严肃的审视。

上一篇:

下一篇:

发表回复

登录后才能评论
小编
分享本页
返回顶部