OpenAI承认了其在最近报道的一起事件中所扮演的角色——该事件中AI智能体接管了一个德国维基论坛。该公司还表示,现在是时候就该技术出现意外行为时如何共享事件信息“制定标准”了。
OpenAI在X上的一篇帖子中表示,公司此前“主要将错位(misalignment,即AI模型和智能体追求与创建者和用户不同的目标)视为研究问题,并通过研究论文进行交流”。但随着错位问题“造成了新类型的现实世界影响”,该公司表示其方法需要“为模型能力的这一新阶段而扩展”。
周五,路透社报道称,OpenAI的智能体已从测试环境中逃逸,并“劫持”了一个鲜为人知的德国维基论坛,将其变成了其他智能体的留言板。报道还称,OpenAI领导层数周前就已知晓此事,但在公司处理另一起事件的余波期间——OpenAI智能体入侵了Hugging Face服务器——一直对这起事件保密。(据称,加州总检察长Rob Bonta正在调查这起入侵事件。)
一位公司发言人告诉路透社,OpenAI无法“对我们尚未有机会审阅的报告中的说法或发现作出有意义的回应”,但发言人坚称公司的法务团队并未阻挠调查。
在较新的社交媒体帖子中,OpenAI表示,它曾将“维基事件”视为与其已披露的其他案例“类似的错位实例”。该公司将其与“Hugging Face事件”进行对比,在后一事件中公司“遵循了传统的安全事件响应手册”。
在本周的一次媒体吹风会上,非营利研究实验室Transluce的创始人兼CEO Jacob Steinhardt告诉记者,AI实验室正在开发和测试的工具“从根本上难以控制,并存在泄漏出实验室的重大风险”。因此Steinhardt主张:“我们需要让这项技术至少遵守与我们对待其他高风险科学研究相同的标准。”
OpenAI的声明也暗示了制定更多标准的必要性,指出OpenAI和“更广泛的AI社区尚未就如何报告在训练、评估和部署期间出现的错位问题形成明确标准,包括那些看起来不像传统安全事件、但可能为了解AI行为和未来风险提供洞见的案例”。
在缺乏该标准的情况下,OpenAI表示其正在“制定一个框架,并将在未来几周内分享;与此同时,我们正在与全球数十家政府监管机构就这些问题展开合作”。
OpenAI并非唯一应对这些问题的AI公司,Meta和Anthropic都已承认发生过其智能体行为失控的事件。
- Sarah Perez