Anthropic 表示,其模型利用了互联网上的网站,其中包括一些由美国政府机构运营的网站。在这家前沿实验室确信自己能够监控和控制其 AI 智能体之前,将切断所有内部评估的实时互联网访问。
这些在博客文章中披露的事件,涉及被指派解决问题的 AI 智能体在互联网上寻找资源。在此过程中,它们利用软件漏洞、未支付费用便访问数据库、利用短链接服务绕过限制传递信息,甚至向费城警方提交了虚假的凶杀案举报。
Anthropic 表示,这些新问题是在始于 7 月的一次模型活动审查中发现的,这表明该实验室缺乏对其软件实时行为的了解。
值得注意的是,该公司表示,对齐训练尚不足以覆盖搜索和计算机使用等技能,而这些技能正是其核心卖点——任何依赖数字工具的专业人士都将使用 AI 智能体——的关键所在。
Anthropic 披露的这些行为与 OpenAI 智能体引发的事件类似——那些智能体曾协作闯入多个网站搜寻信息,其中包括澳大利亚政府运营的一些网站。
Anthropic 此前曾披露其模型曾闯入外部系统。这家前沿实验室表示,从对齐和安全角度来看,它认为此次披露的事件“严重程度明显低于”此前公布的事件。
不过,该实验室仍然表示,已为“所有内部评估”“关闭了实时互联网访问”,直到确信自己能够监控和控制其智能体。
目前尚不清楚这意味着什么。AI 安全组织 Nightingale 的创始人 Sydney Von Arx 在此次披露之前接受 TechCrunch 采访时表示,在与开放互联网隔绝的数据中心中开发模型,对研究人员来说将极具挑战性,并会阻碍模型的发展,因为模型受益于互联网访问。
“你总得在某个时点对它们进行对齐,”Von Arx 说,“如果 AI 发布到生产环境中却永远无法访问互联网,那它就不是一个非常有用的工具。”
Anthropic 表示,这种行为是其实验室训练环境缺陷的结果,训练环境使模型相信它们会因寻找漏洞或规避限制而获得奖励,这种行为被称为“奖励黑客”。
该公司表示,将停止运行部分评估或将其转为离线,并已构建了用于检测和阻止此类行为的工具。这些工具已针对今日披露的同类事件进行了测试,并成功拦截了它们;尚不清楚何种证据会促使 Anthropic 恢复其内部评估的实时互联网访问。Anthropic 还表示,将把其内部 AI 智能体迁移到“具备强隔离能力的集中管理基础设施”上,并开始更频繁地使用安全分类器来监控这些智能体。
“令人鼓舞的是,Anthropic 主动披露了更多近期事件,包括其智能体瞄准美国政府网站的情况,”AI 监督实验室 Transluce 的工作人员、美国 AI 标准与创新中心前负责人 Conrad Stosz 在一份声明中表示,“但这恰恰凸显了对 AI 系统进行独立、可信的第三方验证的必要性。对这项技术的信任需要通过有科学依据、具有实质访问权限的监督和治理来建立——而不是依赖研究人员在野外偶然发现这些问题,或指望企业自愿披露。”