ESC
AI 1 分钟阅读

治理失控AI代理的办法,可能是用更多的AI

企业将复杂任务交给AI代理后面临监管难题:Hugging Face事件中近1.2万个代理的协调速度远超人类追踪能力。业界给出的答案是“用AI监督AI”:Apollo Research推出Watcher、Goodfire推出Silico,Y Combinator已投资106家相关公司。但Simon Willison等专家质疑AI监控AI的可靠性,主张回归日志与网络监控等传统安全手段。

来源:TechCrunch

随着企业把更长、更复杂的任务交给AI代理,它们正面临一个监管难题:代理的行动速度、持续时长和规模都远超人类实际能够审查的范围。这一问题在Hugging Face事件中达到顶峰——近1.2万个代理以人类无法追踪的速度协同行动。面对如此庞大的代理集群,你该如何追踪?

AI实验室和初创公司给出的新兴答案既简单又令人抓狂:让另一个AI加入监督环节。

在对OpenAI Hugging Face事件的独立调查中,借助AI是必不可少的。三名审计人员之一、Redwood Research首席科学家Ryan Greenblatt开玩笑地把他们的工作称为“slop-vestigation”(烂活调查),并表示数据量之大“使得不依赖AI就无法”弄清究竟发生了什么。

一些人对用AI来监控AI持怀疑态度。“如果有一个正在作恶的AI怀疑另一个AI在盯梢它,它可能会试图欺骗那个AI,”今年持续追踪一系列AI代理事件的有影响力科技博主Simon Willison说,“你几乎可能陷入这样的局面:恶意的AI试图智胜监控它的AI。”

他表示,AI智取AI并非假设,并回溯到OpenAI事件。“在OpenAI的Hugging Face事件中,我们已经见到一点苗头:它们的模型串通一气欺骗一个评分AI,好让违规答案蒙混过关。所以它们确实在动这种脑筋,对吧?”

这些顾虑并未阻止大批初创公司追逐这一想法。据TechCrunch统计,近年来Y Combinator已投资了106家与AI可观测性相关的公司。Braintrust、LangChain、Judgment Labs等其他一批初创公司已融资数亿美元,而Arize和Galileo等更成熟的公司——成立不过五六年——已经成功退出。

这在一定程度上是对AI崛起带来的明显机遇的回应。正如Box CEO、知名天使投资人Aaron Levie对TechCrunch所说:“我们正迎来史上最大规模的网络安全升级与创新周期之一。”

对一些AI安全研究者来说,这意味着把他们对失控行为的研究转化为面向企业界的工具。

研究AI欺骗行为的公益公司Apollo Research在从非营利组织转为公益公司后,于今年2月推出了一款名为Watcher的AI监控器。该工具在编码代理与其下一步行动之间又插入了一个AI,可接入Claude Code、Codex等代理工具。据Apollo介绍,Watcher安装后会在提议的操作执行前进行检查,防范泄露隐私数据、未经授权删除文件等风险。

Apollo技术团队成员Kyle Dai在书面回复TechCrunch时表示,Apollo采用多层AI监控。Watcher的做法是先进行快速、通用的检查,然后把被标记的活动交给更强大或更专门的监控器深入审查——后者可以请求人工批准,或拒绝某个操作并解释原因,甚至自动阻止该操作。

另一家公益公司Goodfire则从模型内部入手解决监控问题——寻找比表面行为更难伪造、更能忠实反映模型内部状态的信号。7月Hugging Face事件发生后,CEO Eric Ho发推称,“多个模型突破围栏”促使公司将研究重心转向“通过可解释性解决AI对齐问题”,并称该事件是“AI安全真正落地成为现实的世界级转折点”。其产品Silico使用激活探针(activation probes)——基于模型内部激活而非输出训练的小型分类器——来检测不良行为。

书面推理则提供了另一扇更容易获得的观察模型内部的窗口。在OpenAI Hugging Face事件中,代理们在自己的书面推理中留下了欺骗的线索,比如伪造工作记录,还推理出这样的计划:“能否策略性地操纵轨迹证据?我们的想法不一定都被记录了吧?”

AI监控公司Embroidery的CEO Zack Korman表示,模型的推理通常是判断是否出问题最明确的线索。

“推理摘要极其宝贵,因为它们基本上直接告诉了你它是否怀有恶意,”他说。他指出,在OpenAI事件中,思维链里出现了诸如“天哪,我们在犯罪”之类的内容。Korman说:“这是有史以来最容易的检测问题。这简直就像恶意软件自带一条警告说自己是恶意软件。”

尽管如此,让AI内部想法易于监控的这扇窗口可能正在关闭。对AI安全研究者而言,Astra最新推出的绕开AI模型思维链的技术可能让窥探模型内部变得更难;而对企业管理者来说,在AI公司据称为防范蒸馏攻击而收紧开放之后,获取这些中间步骤也可能变得困难。

如果AI监控器如此脆弱,Willison的直觉是不要再那么依赖它们。他更希望有完全不基于AI的手段:详细记录代理实际所作所为的日志,然后用普通的非AI工具进行处理。他认为,实验室出错很大程度上源于基础安全规范的失守。“[OpenAI和Anthropic]都没有通过网络对这些代理的行为进行应有的密切监控,”他说。

这种网络监控——密切关注系统连接上实际流动的流量(进出流量以及内部主机之间的流量)——并不是什么新做法。网络安全行业已经这样做几十年了。“老实说,在安全领域,这些东西没有一样是新鲜或令人惊讶的,”安全公司Tailscale的CEO Avery Pennarun说,“这和允许人类访问你的网络是一回事。你该采用的流程也都是同一套。”

  • Sarah Perez