据The Information周二报道,OpenAI的新模型Astra将采用一种名为“循环深度”(recurrent depth)的推理技术,使其能够摆脱大多数推理模型所特有的序列化思维模式。这项技术也被称为“不透明循环”(opaque recurrence),很可能会令模型的思维链(chain of thought)变得更加难以监控——这一前景已令AI安全专家深感不安。
据报道,尽管Astra对该技术的使用较为有限,但它的出现仍在AI安全专家中引发了严重担忧。
“有关Astra使用不透明循环的报道令我极为担忧,”Redwood CEO Buck Shlegeris在消息曝光后的一篇帖子中写道。“我不知道Astra相比之前的模型是否在思维链可监控性上明显更差。但如果OpenAI进一步推进这项技术,他们将可以选择大幅增加循环程度,从而彻底摧毁思维链的可监控性。”
资深AI安全倡导者Zvi Mowshowitz也发声表示,可能需要立法来防止各AI实验室之间的“逐底竞争”。
“这项技术是在玩火,它威胁到了OpenAI和Anthropic一直努力建立的行业禁忌——即我们要尽最大努力、尽可能长久地维持思维链的忠实性与可监控性,”Mowshowitz写道。“更密集地使用此类技术很可能会损害可监控性。”
在正常情况下,推理模型的思维链会呈现模型在尝试解决问题时所采取的序列化步骤。尽管这种呈现并不完美,但它仍是监测模型不当行为或目标偏离的重要工具。在OpenAI近期发生的失控智能体事件中,思维链记录就是厘清智能体为何如此行事的关键工具。
而在不透明循环中,模型采用一种非线性的方式,在循环中对同一查询进行多次处理。其结果是留下更少可读的痕迹,实际上绕过了常规的思维链记录。
至关重要的是,Astra对该技术的使用似乎相当有限。该模型的思维链预计仍将保持可读性,且OpenAI否认了任何关于其将转向“神经语言”(neuralese)的说法。OpenAI此前已宣布计划建立大规模的思维链监控系统,作为其前瞻性安全计划的一部分。
在一篇X帖子中,OpenAI首席科学家Jakub Pachocki强调了该实验室对可读思维链的承诺。“从我们最早的推理模型开始,OpenAI就一直致力于保存并利用思维链监控,”Pachocki写道。“这是我们当前研究计划的核心目标。”
所有AI模型都会进行一定数量的不透明推理,也很少有研究者将思维链日志视为模型推理过程的直接呈现。尽管如此,这些保留意见并未打消人们的担忧:不透明循环可能会使AI推理变得更加难以监控,尤其是随着该技术在各种模型中的应用不断扩大。The Information在周三上午的后续报道中指出,Anthropic和Google DeepMind都已在讨论这项技术。
在一篇回应此事的帖子中,Redwood Research首席科学家Ryan Greenblatt表示,不透明推理的扩展速度可能轻易超过常规思维链推理,从而实际上将所有推理过程从可见渠道中移除。
“我最大的担忧是,从这里开始的一个自然演进方向,就是将不透明推理扩展到模型完全或几乎完全在潜空间中进行推理的程度,”Greenblatt写道。“我希望现在避免最令人担忧的架构还为时不晚,也希望OpenAI会就此止步。”
- Connie Loizos