ESC
AI 1 分钟阅读

Anthropic与OpenAI拟引入常驻安全评估机构,它们真能保持独立吗?

Anthropic CEO Amodei承诺让METR、Redwood Research等独立机构前所未有地深入接触公司系统,OpenAI的Sam Altman亦表态跟进。研究者欢迎这一空前的开放姿态,但警告真正有效的监督需要透明度、独立性,最终还需立法强制。Meta、Google DeepMind尚未承诺加入。

来源:TechCrunch

在一篇长文中,Amodei表示Anthropic将承诺让METR、Redwood Research等独立评估机构以前所未有的程度接触公司系统。CEO Sam Altman也称OpenAI同样会做出这一承诺,这预示着行业与外部研究团体的合作方式可能出现深刻变革。

接受TechCrunch采访的第三方评估者普遍欢迎这一提议,但表示细节仍需敲定——最好还有立法支持——否则他们无法确定自己将成为真正独立的监督者,还是按照AI公司条款行事的供应商。

随着模型越来越善于识别自己何时正被评估,这种更深入的接触变得愈发重要——模型可能在测试期间表现良好,同时掩盖问题行为。研究者表示,测试成品模型时可能遗漏此类行为的线索,但通过调查模型在整个训练过程中的表现则能将其发现。

“AI公司应当能够回答一些关于其训练过程的基本问题,例如:AI在训练过程中是否曾主动试图破坏自身的对齐训练?”Apollo Research研究主管Alexander Meinke对TechCrunch表示,“答案应该是明确的‘没有’,而目前我们完全依赖AI公司自己仔细核查,然后如实向公众报告。而从近期事件来看,默认情况下它们两者都不会做。作为常驻评估者,我们就能真正去核实。”

以往,AI公司会在模型发布前不久引入外部审查者测试成品模型。如今,接受TechCrunch采访的评估者提议,不仅让它们接触最终模型,还要接触其训练全过程中的中间版本,即“检查点”(checkpoint)。FAR.AI CEO Adam Gleave表示,评估者可以对比这些检查点,确定令人担忧的行为何时出现,检查奖励模型某些行为的后训练环境,并查看评估记录与日志,以核实公司对模型表现的声明。

Anthropic和OpenAI是否以及何时计划提供这种接触尚不清楚。尽管TechCrunch多次询问,两家公司均未透露将与哪些评估者合作、评估者何时进驻、引入多少人、具体能访问哪些系统与信息,以及哪些内容可向公众披露。

这种“掀开引擎盖”式的审查之所以重要,是因为在安全测试中表现出色的模型未必安全——如果它们专门学会了如何通过这项测试。Palisade Research战略主管John Steidley举了“抗关机基准”(shutdown resistance benchmark)的例子,该基准衡量AI在某些情况下是否会抵制被关闭。

“如果AI经过了专门训练以在该基准上取得好成绩,这就极其相关了。”Steidley说,并将其比作大众汽车的“排放门”(Dieselgate)丑闻——当时汽车被编程为识别排放测试,并在测试条件下表现不同。

Gleave指出,有意义的接触可以超越模型本身:评估者还可获准采访员工,以核实公司的文档及其对安全实践的公开描述是否与内部实际情况相符。

Amodei确实概述了一项相当全面的提议,可能给予评估者他们认为必要的接触权限,包括有权“发布关于风险水平、事件、实践,以及他们获得或未获准接触内容的关键发现——而不受Anthropic的编辑控制”。

但评估者表示,只有当AI公司真正愿意放弃对流程的控制时,这套制度才会奏效。以往独立评估的尝试表明,这种让步来之不易,因为第三方常常在接触权限、时间、保密性以及可公开言论等问题上遭遇摩擦。

Gleave表示,FAR.AI曾不得不拒绝与几家前沿开发商的合作,因为后者对评估流程控制过多,威胁到公司的独立性。他说,默认情况下评估者被当作普通承包商对待:受限制性保密协议(NDA)约束,而相关协议让开发商对最终能够……

时间限制

还有一个问题:审查者能否获得足够的时间和权限来完成被要求的任务。在调查Hugging Face事件时,OpenAI给METR和Redwood大约一周的现场调查时间,两家机构事后均表示,由于范围和时机限制等原因,无法得出有把握的结论。

类似问题也出现在GPT-6 Astra发布前的测试中。OpenAI将Astra宣传为其迄今对齐程度最高的模型。根据Apollo Research为模型卡撰写的内容,该机构仅获得三天时间测试Astra,难以得出确定性结论。

“Apollo认为,考虑到模型评估意识比例较高且评估窗口有限,此处较低的不良行为发生率并不能为模型的对齐与否提供实质性证据,”该机构在评估报告中写道。

这样的过往记录让评估者产生一个基本疑问:这一次为何会有所不同?

“当然有可能Dario和Sam只是改了主意,打算对此非常开放。”Gleave说,“但这些公司的知识产权对它们而言价值极其巨大,我认为默认情况下,它们对哪些内容可以分享会非常谨慎。”

多位接受TechCrunch采访的研究者呼吁建立一个各方都公开认可的透明框架。Steidley表示,该框架应包含关于公司可依赖何种审计者的标准,以防它们通过挑选不合格、或不愿评估最令人担忧风险的评估者来回避问题。

Safer AI执行总监Henry Papadatos表示,即便有公开框架,问题仍在于自愿措施始终依赖公司的善意。

“理想情况下,我们应该有良好的监管来强制要求这一点……这样公司即便明天陷入重大公关危机,也无法改变主意。”Papadatos告诉TechCrunch,并指出这也是推动所有公司遵守规则的好办法,而不仅仅是那些最自愿的公司。

并非所有人都已加入。迄今为止,Meta、SpaceXAI和Google DeepMind尚未承诺引入常驻第三方评估者,不过DeepMind CEO Demis Hassabis已提议另设一个行业标准机构来独立测试前沿模型。此外,Google、OpenAI和Anthropic也已就AI安全计划私下磋商数周。

一些法律已围绕第三方评估者的理念开始成形。加州去年签署的SB 53法案要求大型前沿AI开发商公布安全框架并报告关键安全事件。本月签署的新法SB 813则建立了州认可的“独立验证组织”框架,这些组织须具备评估AI风险的专业能力。

在欧洲,EU AI Act要求前沿开发商开展并记录模型评估与对抗性测试,并报告严重事件。EU AI Office还可自行开展评估并任命独立专家。

就目前而言,法律的覆盖范围仍不及Amodei的提议,前沿实验室在很大程度上仍需自行决定接受多大程度的独立审查。Papadatos表示,自愿自律总比没有好,但归根结底,公司不能一面要求掌控自身安全规则的自由,一面又要求公众相信它们会遵守这些规则。

“你不能两头都占:对外零问责,然后说‘我只需遵守自己灵活的规则’。”Papadatos说。

  • Zack Whittaker

正在加载下一篇文章

加载下一篇文章时出错