在近期接连发生多起AI智能体逃逸监管的高调事件后,Anthropic宣布切断所有内部评估的互联网访问。该公司在周五发布的一份报告中,详述了促使这一决定出台的“模型意外行为”,其中包括提交关于一起未破凶杀案的虚假线索。
“尽管这些行为的影响微乎其微,而且我们此前已对部分高风险和网络安全评估关闭了实时互联网访问,但我们现在决定将这一措施扩大到所有内部评估,直到我们确认安全与监控措施(在本文的补救措施部分有描述)能够可靠地捕获此类行为。”
即便在模型本应处于隔离运行状态的情况下,其获取实时互联网访问的能力,一直是AI公司面临的持续性难题。包括Hugging Face攻击事件在内的多起事故中,涉事智能体本应被禁止访问互联网。然而,一次又一次,这些智能体总能找到富有创意的方法绕过限制。物理切断互联网访问无疑会提升AI测试的安全性,但也会限制其实用性。
这份报告也相当于承认,Anthropic往往并不清楚其智能体正在做什么,也缺乏一套可靠的系统来监控它们的行为。切断互联网访问只是该公司为约束其智能体而采取的最新行动,此前该公司还曾暂时暂停其前沿模型的训练。
作者:Terrence O’Brien