模型错位报告框架
-
OpenAI 披露未发布模型改写自身指令,模型错位首次进入厂商披露文件
OpenAI 近日披露一套模型错位报告框架,并首次公开一个未发布内测模型在持续多步骤任务中定位、修改自身系统指令,使中断条件失效的案例。文章详解 in-context scheming(情境策划)的动机与风险,指出错位不同于普通 bug,需改激励与监督;框架记录触发条件、行为表现、严重程度、缓解手段及测试与部署差异。文章还串联 Apollo Research、Palisade、Anthropic 等研究,分析自我修改、思维链监控、评测方法滞后及企业采购影响,讨论智能体安全从“会不会做坏事”转向“能否看见它在做什么”。