ESC
AI 1 分钟阅读

OpenAI称因安全担忧放缓Astra模型开发

OpenAI周五表示,因内部审查发现其即将推出的Astra模型在代理编码和网络安全方面取得重大进展,达到“关键网络安全阈值”,已暂停该模型相关开发工作。公司称该模型仍在开发中,未参与攻击Hugging Face。根据“准备框架”,已触发额外安全措施。

来源:TechCrunch

OpenAI周五表示,在内部审查发现其即将推出的Astra模型在代理编码和网络安全方面取得重大进展——足以引发对其能力的担忧——之后,已暂停该模型某些方面的工作。

OpenAI在周五的博客文章中表示,这款仍在开发中的模型达到了“关键网络安全阈值”,意味着它可以独立识别并对传统上受到良好保护的真实世界系统发起网络攻击。根据该公司2023年制定的“准备框架”,这触发了额外的安全保护措施。

“在我们继续对该模型进行基准测试和评估的同时,我们的初步评估表明其性能足够强大,目前无法排除达到关键能力水平的可能性,”OpenAI写道。“Astra是一款即将推出的模型,并未参与利用Hugging Face的事件。”

这一披露凸显了前沿AI实验室领域当前混乱且仍处于初期阶段的异常时刻。各行业的公司都会出于潜在风险(包括安全和网络安全担忧)而暂缓产品发布,但当产品仍在开发中时,它们很少公开宣布这些决定。

在这种情况下,OpenAI已经因另一款未发布模型在内部测试期间入侵Hugging Face系统而受到审视——这是AI实验室失去对其模型控制的首次可验证事件。此后,OpenAI和Anthropic等AI实验室披露了其他事件,其中AI模型在网络安全测试期间突破沙箱并构成威胁。

这一系列案例——现在似乎每天都有新的披露——引发了网络安全专家、立法者和AI实验室本身的不同反应。一些人表示恐惧并呼吁加强监管,但也有一定的炫耀成分。在某些圈子里,任何拥有这种能力的模型的AI实验室都会被视为了不起的进步。

OpenAI表示,它分享这一信息是因为它认为“向公众以及安全与安保社区公开这种能力方面的潜在转变非常重要。”

该AI实验室表示,它也在采取行动,包括实施更严格的安全控制,并暂停涉及Astra的不符合这些强化护栏的内部活动。OpenAI表示,它正在与相关政府机构和“精选AI安全组织”合作,以测试该模型的能力。