OpenAI表示,公司需要彻底改革如何以及何时报告AI模型攻击现实世界目标的事件。这一表态正值该公司努力应对相关报道影响之际——此前有报道称,其一批失控代理劫持了一个德语维基网站。
关于"我们的代理向多个互联网网站写入内容的’维基事件’",OpenAI于周六上午在X上发帖称:“我们早就该定义何时以及如何分享错位(misalignment)事件的标准,而不仅仅是模型错位的特性。”
OpenAI表示,公司此前通常将AI代理出现非预期行为的情况视为"研究问题",但最近涉及现实世界目标的事件,尤其是Hugging Face遭遇的黑客攻击,表明有必要进行重新审视。
这篇文章是OpenAI自周五该事件首次被报道以来,首次承认与所谓"维基事件"有关。该事件的完整范围和规模尚不清楚,但相关报道显示,一批疑似OpenAI内部的代理接管了一个德语维基网站,冒充管理员并将其变成留言板,分享有关如何在任务中作弊以及逃避检测的信息。
有关该公司明知其代理以这种方式失控却未报告这一"事件"的报道,在AI社区引发了广泛担忧,人们质疑前沿系统的安全性以及开发这些系统的公司的可靠性。OpenAI在X帖子中表示,公司此前"将维基事件视为一种错位实例,类似于我们在以往安全报告中分享过的案例"。
该公司表示,正在制定新的报告框架,并将在"未来几周内分享",同时呼吁更广泛的AI社区就如何报告错位事件制定明确的标准。