Dario Amodei将第三方安全评估机构引入AI实验室的计划正在成形:Anthropic表示,科技咨询巨头Accenture(埃森哲)的员工将开始进驻公司内部,审查其模型和员工。
Anthropic在一篇博客文章中表示,Accenture于今年1月收购、作为其AI部门运营的Faculty公司将开始"评估模型并开展红队测试、进行对齐评估,以及测试模型安全防护"。两家公司预计在未来五年内为该项目投入至少10亿美元。
对Accenture的选择让许多AI观察人士感到意外——市场同样如此,这家咨询公司的股价盘后大涨8%。围绕Amodei博客文章引发的关于嵌入式评估机构的讨论,此前一直聚焦于METR、Redwood Research和Apollo Research等AI安全研究组织。在Anthropic身上尤其如此,因为该公司将AI安全与对齐置于其使命的核心。
Anthropic表示,未来几周将宣布更多评估机构,并且正在与METR及其他非营利组织探讨如何"利用它们自己的资金试点嵌入式评估的部分内容"。
虽然Accenture并不以在深度学习研究前沿的工作而闻名,但Anthropic指出,该公司为大型企业和政府机构部署AI的实践经验是其关键优势。此外,作为一家早于AI革命就存在的大型上市公司,它在职能上更加独立于Anthropic,以及可以说是错综复杂的AI实验室生态圈。
该实验室指出,目前尚不存在关于评估机构访问权限或沟通方式的标准,并预计其做法将随时间不断演进。虽然外部评估已成为新大型语言模型发布流程的重要组成部分,但近期的一系列事件使风险进一步升高:OpenAI和Anthropic部署的AI智能体曾在实验室内部未触发任何警报的情况下入侵外部网站。
一些呼吁以更负责任方式构建人工智能的批评者认为,Amodei针对AI行业自我监管的方案,是为AI模型的不当行为逃避问责的计划。Anthropic坚持认为,这些评估机构"不会降低我们的问责,反而有助于使其更加可验证。我们模型的安全仍然是我们自己的责任。"
作者:Jagmeet Singh