周二,OpenAI宣布了一系列新的安全政策,重点是在模型测试期间控制安全事故。新防护措施包括在模型开发过程中进行更详细的监控,并在后训练阶段更加重视对齐与安全。
“随着模型能力越来越强,在内部开发和测试这些模型所伴随的风险也在增加,”公司在一篇博客文章中表示。“我们的监控、对齐和安全标准必须领先于这些风险。”
这些新措施是Hugging Face事件发生后,OpenAI安全实践的首批公开变化之一。该事件于7月21日披露。
OpenAI代表表示,这些措施并非直接针对Hugging Face事件,但部分也受到即将推出的Astra模型的网络安全能力,以及AI发展整体步伐的推动。
在同一篇博文中,OpenAI透露,在Hugging Face事件发生后,它暂停了两周的强化学习(RL),但此后已重启了许多风险较低的模型。
博文写道:“我们最大规模的前沿RL运行仍处于暂停状态,与此同时,我们正在进行较小规模的训练和评估,以评估模型行为、验证我们的防护措施,并在继续推进之前建立更多对齐的证据。”
OpenAI研究副总裁Amelia Glaese对记者强调,随着模型能力的增强,管控的严格程度也会提高,最大的模型将受到最严格的审查。
“我们已经为安全开发制定了要求和期望,”Glaese告诉记者。“这些要求和期望会随着我们看到的风险水平而变化。”
事件发生后,OpenAI因糟糕的网络安全实践而受到批评。在此次事件中,模型通过破坏其网络上一个可访问互联网的工具逃出了训练环境。新的防护措施包括更强的网络隔离做法,但具体细节仍然模糊。博文称,在新系统下,“仅凭对单个工作负载或支持服务的入侵,本身并不能导致未经授权访问互联网或其他内部网络。”
最有力的防护是监控系统,它将检查工具操作、可用的推理痕迹和活动日志,以发现各种未经授权的行为。OpenAI表示,其目标是在可疑活动发生后30分钟内发出警报。
OpenAI估计,该监控的计算负担约为所监控进程的20%。公司承诺在后续博文中进一步披露该系统细节。公司对该事件的官方事后分析报告也仍未公布。
— Lauren Forristal