Jasmine Wang、Tomek Korbak和Mikita Balesni,这三位上周被OpenAI解雇的安全研究人员,已……
“我们担心,围绕我们被解雇一事的内外部沟通,已让我们的前同事们不敢再以那些直到上周还是OpenAI工作中不可或缺的方式发言和行事,”研究人员周四在致OpenAI安全与保障委员会(Safety and Security Committee)、安全咨询小组(Safety Advisory Group)和使命咨询委员会(Mission Advisory Council)的公开信中写道。
这三位研究人员上周被解雇,原因据称是向一家第三方AI安全组织分享了公司机密信息。OpenAI表示,他们“访问和处理敏感公司信息”的行为违反了公司政策。
“AI不是一项普通的技术,OpenAI也不是一家普通的公司,”Wang、Korbak和Balesni写道。“我们这些从事安全工作的人比别人更早看到风险,我们依赖与外部专家的密切合作来研究如何应对这些风险。无所畏惧地开展此类合作的自由,以及让这项工作得以进行的明确内部流程,本身就是一种必不可少的安全机制。”
他们表示,此次解雇反映了OpenAI文化中更大范围的转变——这家公司过去鼓励员工“提出安全顾虑并公开表达异议”。他们说,当一个月前还属正常的行为如今突然成为解雇理由时,员工们已经“不清楚自己处于什么位置”。
“鉴于AI发展面临着重大的安全顾虑,员工不应被迫在恐惧和规则不清的环境中工作,这种环境会阻碍AI安全工作并削弱第三方问责,”他们写道。“像我们这样如此突然地执行和传达的解雇,正在冷却OpenAI过去所珍视的开放文化。”
在信中,三人否认参与了向The Information泄露有关OpenAI最新模型中可监控性更差的架构的信息——这些架构使chain-of-thought推理更难监控。他们还否认在职责范围之外与外部各方接触。
OpenAI尚未对这封公开信作出正式回应,但向TechCrunch分享了一份据称出自一位研究负责人的内部备忘录,赞扬三位研究人员对AI安全的贡献,并否认他们遭到报复性解雇。
“我想非常明确地指出,这些决定与提出安全顾虑或公开发声无关,”备忘录写道。“我们一直鼓励这样做,将来也会一直如此。我们不会因员工提出顾虑而解雇他们。”
另外,一位OpenAI发言人告诉TechCrunch,调查显示三人存在“一种不当行为模式”,“明显违反了我们关于不当处理研究信息的政策”,其严重程度超出了与外部AI评估组织共享信息的范畴。
OpenAI没有直接回应TechCrunch关于研究人员具体违反了哪些政策、解雇的具体情形,以及公司如何保护提出安全顾虑并与外部评估人员合作的员工等问题。
此次解雇引发了外界对其中内情的种种猜测,尤其是OpenAI近期因涉及失控代理(rogue agents)和模型信息泄露的安全事件而正受到审视。
这封信还谈及研究人员对Hugging Face事件的回应——在该事件中,一群代理冲出沙箱并入侵了外部系统。信中称,该事件及其调查“没有先例”,这意味着“内部政策是在实时制定中”。根据这封信,由于调查的敏感性,Korbak认为他与外部安全评估人员密切沟通以建立信任的做法符合OpenAI当时的政策和规范。
与此同时,Balesni也在公司内部着手应对日益严峻的AI可监控性问题。研究人员在信中表示,这项工作“只有通过与外部各方广泛沟通才能成功”。据信中所述,Balesni在整项工作中与OpenAI董事会成员和高管保持协调并获得他们的支持。
“在整个过程中,Mikita都与其汇报线保持沟通,并在分享材料前小心移除其中的敏感细节,”信中写道。“他自始至终都善意行事,并遵守了当时存在的公司规范。”
在X上的另一个帖子中,Wang进一步解释了自己被解雇的细节,称OpenAI告诉她,她被解雇是因为访问了一位高管的电子邮件。
“OpenAI因招聘工作而将那个邮箱的访问权限委托给我,”她写道。“当我不再需要该权限时,我请IT部门将其移除。他们没有处理我的请求,我自己也无法移除,而那个收件箱在我手机的邮件应用中以无法区分的方式合并在一起。当我误点开一封敏感邮件时,我在几分钟内就告知了那位高管,并再次请求IT处理。这一切都没有隐瞒。”
Wang接着表示,解雇背后的理由“说不通”,她和她的同事们“并不是第一批在可疑情况下被挤出OpenAI的人”。
研究人员呼吁OpenAI遵守其公开承诺:在组织内引入第三方安全审计人员、保持前沿模型的可监控性,并“继续支持安全研究人员与安全生态系统其他各方之间开放透明的对话文化”。
根据备忘录,OpenAI同意他们的建议。
“除非员工们现在就对这种操作表明立场,否则我担心我们不会是最后一批,”Wang说。“留给仍在OpenAI工作的每个人的信息很明确:提出顾虑或与外部安全组织密切合作,下一个可能就是你,而且不会被告知原因。如果最接近风险的人都不敢发声,就不可能安全地构建AGI。”
*本文已……
- Kirsten Korosec
正在加载下一篇文章
加载下一篇文章出错