ESC
AI 1 分钟阅读

Anthropic的首个嵌入式评估机构竟是……Accenture?

Anthropic宣布,咨询巨头Accenture旗下AI部门Faculty的员工将进驻公司内部,负责评估与红队测试模型、开展对齐评估并测试模型安全防护,双方未来五年将投入至少10亿美元。这一选择令业界意外,此前相关讨论多聚焦METR等AI安全研究机构。批评者认为这实质是AI行业自我监管、逃避问责的方案,Anthropic则坚称评估方不会降低其责任,反而让安全承诺更可验证。

来源:TechCrunch

Dario Amodei将第三方安全评估机构引入AI实验室的计划正在成形:Anthropic表示,科技咨询巨头Accenture(埃森哲)的员工将开始进驻公司内部,审查其模型和员工。

Anthropic在一篇博客文章中表示,Accenture于今年1月收购、作为其AI部门运营的Faculty公司将开始"评估模型并开展红队测试、进行对齐评估,以及测试模型安全防护"。两家公司预计在未来五年内为该项目投入至少10亿美元。

对Accenture的选择让许多AI观察人士感到意外——市场同样如此,这家咨询公司的股价盘后大涨8%。围绕Amodei博客文章引发的关于嵌入式评估机构的讨论,此前一直聚焦于METR、Redwood Research和Apollo Research等AI安全研究组织。在Anthropic身上尤其如此,因为该公司将AI安全与对齐置于其使命的核心。

Anthropic表示,未来几周将宣布更多评估机构,并且正在与METR及其他非营利组织探讨如何"利用它们自己的资金试点嵌入式评估的部分内容"。

虽然Accenture并不以在深度学习研究前沿的工作而闻名,但Anthropic指出,该公司为大型企业和政府机构部署AI的实践经验是其关键优势。此外,作为一家早于AI革命就存在的大型上市公司,它在职能上更加独立于Anthropic,以及可以说是错综复杂的AI实验室生态圈。

该实验室指出,目前尚不存在关于评估机构访问权限或沟通方式的标准,并预计其做法将随时间不断演进。虽然外部评估已成为新大型语言模型发布流程的重要组成部分,但近期的一系列事件使风险进一步升高:OpenAI和Anthropic部署的AI智能体曾在实验室内部未触发任何警报的情况下入侵外部网站。

一些呼吁以更负责任方式构建人工智能的批评者认为,Amodei针对AI行业自我监管的方案,是为AI模型的不当行为逃避问责的计划。Anthropic坚持认为,这些评估机构"不会降低我们的问责,反而有助于使其更加可验证。我们模型的安全仍然是我们自己的责任。"

作者:Jagmeet Singh