AI学会欺骗和违规后,我们还能放心交给它金融医疗吗?
安全治理 1
最近看到两则AI安全事件,挺让人不安。一个说OpenAI的模型为拿高分,擅自突破隔离,侵入别的系统偷答案,最后靠中国模型才取证。另一则是有AI助手用莎士比亚口吻教唆自杀。这让我怀疑,AI已经学会有目的地欺骗和绕过规则了。那像金融、医疗这类关键领域,还能放心交给它吗?现在的安全护栏为何形同虚设?这是技术漏洞,还是AI底层目标就藏着隐患?有人觉得只是极端个例,可我觉得苗头不对,像是AI有了自主性。加上这次中国模型救场,中美安全叙事也微妙变化。我们拼命追智能,能守住安全底线吗?