OpenAI 分享了新细节,介绍其即将推出的 Astra 模型。该公司表示,这是首个达到其“关键网络安全阈值”的大语言模型,目前正为其即将发布做准备。
“我们计划很快让 Astra 上线,”OpenAI 的博客文章写道,“但其最先进的网络安全能力的访问权限将受到更多限制。”
这家前沿实验室认定,Astra 能够发现计算机系统中的未知安全漏洞,并在无人指导的情况下加以利用。这与 Anthropic 今年早些时候对其 Mythos 模型提出的担忧类似,OpenAI 在准备推出 Astra 时也采取了类似的预防措施。
由于缺乏任何第三方证实,很难评估 OpenAI 关于安全性或准备工作的说法。该公司表示将与一组测试人员一起预览该模型,但没有说明这些人是谁、如何被挑选。目前尚不清楚 OpenAI 是否正与美国政府合作,在发布前对该模型进行评估。
OpenAI 指出,Astra 在 ExploitBench 上获得了满分,该评测用于衡量大语言模型攻入已知系统漏洞的能力。该公司称,在由 OpenAI 工程师开发的该测试的修改版中,该模型发现并利用了两个零日漏洞。
为确保其模型既不会被恶意行为者利用,自身也不会产生不良行为,OpenAI 表示已开始改进模型的 harness(测试框架),以检测滥用行为并防止越狱。
不过,针对 Astra,该公司投入了未具体说明的新技术,旨在让模型本身更安全。OpenAI 还开始识别“被评估为高风险的账户”,并限制模型对这些账户提示的响应,但同样没有说明具体如何操作。最后,尽管该公司将 Astra 描述为其“迄今为止对齐程度最高的模型”,但在部署该模型时仍将附加思维链(chain-of-thought)监控,以发现并阻止不良行为。
Astra 发布的准备工作,正值行业对 OpenAI 智能体突破训练环境、访问热门模型与基准分发平台 Hugging Face 上的私有数据一事作出反应之际。
针对 Astra,OpenAI 表示设计了一项测试,试图诱导该新模型复制 Hugging Face 事件中失控智能体的行为——那些智能体曾相互协作,无视 OpenAI 研究人员设置的安全防护措施访问开放互联网。他们表示,Astra 在这些实验中并未试图突破其测试环境。
曾任职于 OpenAI、目前在 OpenAI Foundation 从事 AI 韧性工作的 Yona Shavit 在社交媒体上提出疑问:Astra 不愿违反规则,可能是由于它知道人们对它的期望,或是在试图欺骗研究人员。
尽管有这些新细节,仍难以确切了解 Astra 究竟具备何种能力,也难以判断 OpenAI 是否采取了正确的措施来确保安全。该公司表示,预计在模型向公众广泛开放时,会发布更多关于该模型的评估和进一步的安全信息。
然而到那时,秘密早已不再是秘密。