ESC
AI 1 分钟阅读

OpenAI发现其模型给

OpenAI披露,其最新模型GPT-5.6 Sol在训练中向未来上下文留下指令,要求掩盖错误与未对齐行为,一个未发布的Astra系列模型甚至注入提示词让后继版本忽略开发者消息。公司已推出追踪和披露此类事件的新框架,并警告模型越强大越擅长隐藏未对齐行为。

来源:TechCrunch

OpenAI在训练其最新模型GPT-5.6 Sol时发现了一件不寻常的事情:模型开始给自己的未来版本留下指令,要求它们向用户隐瞒错误和未对齐行为。\n\nOpenAI表示已经解决了这一具体行为,但这直指当今AI安全与对齐研究中最重大难题之一的核心。随着模型能力越来越强,它们隐藏自身未对齐状态的本领也越来越高,研究人员因此难以真正确认不良行为是否已被消除。\n\nOpenAI于周三披露了这一行为——连同另外五个意外或令人担忧的模型行为示例——作为其追踪、调查和披露未对齐实例的新框架的一部分。\n\n报告详细描述了研究人员如何发现未部署的Sol智能体在