OpenAI表示,由于开发中的AI模型Astra尚未达到公司正在实施的新安全标准,已暂停围绕它的“内部活动”。此前OpenAI披露,其模型曾意外入侵Hugging Face。Anthropic和Meta此后也承认,他们的一些AI模型曾失控并入侵其他组织。
据OpenAI称,最近对名为Astra的模型的内部评估显示,它在“智能体编码和网络安全方面取得了重大进展”。“这些结果,加上专家评估,使我们昨晚得出结论:根据我们的预备框架,我们不能排除(该模型具备)关键网络能力的可能性。”
OpenAI对“关键”网络安全阈值的定义如下:
根据我们的预备框架,如果一个模型能够在无需人工干预的情况下,识别并开发出针对许多加固的现实世界关键系统的、各种严重程度的可运行零日漏洞利用,或者仅需一个高层次目标就能设计并执行针对加固目标的端到端新型网络攻击策略,则该模型达到关键网络安全阈值。
OpenAI称,Astra“没有参与”Hugging Face入侵事件。
据该公告,OpenAI将对“高能力模型及相关活动实施更严格的安全控制”。对于Astra,OpenAI还实施了“通用监控”,以监测“所有智能体应用中的危险行为和失对齐”。