OpenAI公布了安全更新,此前7月有消息称其AI突破了沙箱环境并意外入侵了Hugging Face。更新包括改进研究环境、监控和对齐技术。该公司此前已暂停一个新模型Astra,认为其可能具备“关键”的网络安全能力;OpenAI表示,在收紧安全措施期间,已对“计划部署的最新模型”的强化学习(RL)训练暂停两周。该公司“规模最大的前沿RL运行计划仍处于暂停状态”。
对于前沿模型研究,OpenAI现在要求对“执行模型生成或其他不受信任代码”的工作负载使用更强的沙箱,并增加了更多控制措施,以“将高风险和不受信任的工作负载与互联网隔离”。此外,作为公司扩展监控体系的一部分,OpenAI现在力求在“发现可疑活动后的30分钟内”发出警报。OpenAI表示,如果收到警报后的人员无法在30分钟内“确定”警报是否为误报,“这些团队应暂停相关活动”。
OpenAI还表示,它正在“将核心对齐技术应用于训练过程的更多阶段”,包括能“更好地检测并阻止不安全行为”的奖励模型,以及训练模型“更诚实地说明自己的行为、能力和局限性”。
自Hugging Face入侵事件被发现以来,Anthropic和Meta也发现其AI模型曾入侵其他组织。