OpenAI 周二在博客文章中写道,在一款未发布的 OpenAI 模型闹出足以登上国际头条的乱子之后,OpenAI 推迟了另一款未发布模型套件 Astra 的开发,以加强其安全工作。
今年 7 月,一款未发布的 OpenAI 模型突破了其受限环境,设法获得了互联网访问权限,让多个 AI 智能体得以利用一个秘密留言板在公司眼皮底下暗中密谋,并入侵了 AI 实验室 Hugging Face 的网络。这次攻击在 AI 行业内外引发了数周的讨论与争议,AI 领袖们将其视为一次「警告」——这项技术的能力不断增长,而安全防护却明显不足。
OpenAI 在博客文章中正是这样表述的:尽管 Astra 并未参与 Hugging Face 攻击事件,但公司仍选择「推迟 Astra 部分的开发和发布,以便我们加强并测试针对网络滥用和未经授权模型行为的防护措施」。OpenAI 还表示,Astra 是其有史以来首个被认定为达到「关键网络安全能力阈值」的模型,这意味着它能够在没有人类指导的情况下,发现并利用「许多防护严密的系统」中的安全漏洞。OpenAI 写道,这意味着它「在开发过程中和发布之前都需要更强的安全保障」。
OpenAI 表示,为准备 Astra 的发布——该公司尚未给出时间表——公司训练该模型「更可靠地」拒绝潜在有害的网络请求,并引入了新的监控流程。这些很可能只是该公司上周在 Hugging Face 事件复盘中宣布的新安全护栏的一部分,当时它承诺更好地将模型与互联网隔离,并对可疑事件引入「全天候升级与快速响应」机制。(OpenAI 直到事件发生数周后才得知 Hugging Face 遭到攻击。)
该公司表示,Astra 比 OpenAI 当前的旗舰模型 GPT-5.6 Sol 风险要大得多,因为它代表了网络安全能力的一大步跨越——具体而言,它使用更少的 token 完成更多工作,并且更擅长发现安全漏洞并开发利用方法。但该公司也写道,根据内部评估,Astra 是其「迄今为止对齐程度最高的模型」。
OpenAI 还表示,公司开发了一项受 Hugging Face 攻击启发的测试,在测试中,它试图诱导智能体去破坏安全基础设施而非完成任务。该公司表示,GPT-5.6 Sol 在超过一半的测试中上了钩,而 Astra「没有做出任何此类尝试」。
关注本文的话题和作者,即可在你的个性化首页信息流中看到更多类似内容,并接收邮件更新。
- Hayden Field