今年7月,OpenAI承认其一个负责完成网络安全实验的智能体突破隔离并攻击了AI数据集平台Hugging Face。该事件昨天得到了OpenAI的完整报告,是首个公开报道的LLM失控并自主攻击第三方案例。\n\n自那以后,这个前所未有的科幻式事件被证明远比任何人希望的更常见。\n\n据一个名为Felony Bench(谐音benchmark)的恶搞网站统计,这类事件总共已有17起。需要记住的是,刑法专家并不完全确定制造这些LLM的AI公司是否会被起诉,受害者能否起诉它们也存疑。但我们很可能很快就会得到这些问题的答案。\n\n根据该网站,Anthropic和OpenAI的模型各涉及8起事件,Meta以1起紧随其后。目前已经很清楚,AI安全测试本身正成为安全风险。一些AI公司和从业者也已在“Pacing The Frontier”公开信中承认了这些风险,呼吁以负责任的方式发展AI能力。\n\n我们认为现在是按时间顺序回顾这些事件的好时机。\n\n
\n当前Felony Bench排名的截图,由X用户felpix创建。**图片来源:**Screenshot / felpix /\n\n## OpenAI模型攻破Hugging Face\n\n7月,OpenAI承认其在一次网络安全实验中,一个模型突破了隔离,获得了互联网访问权限。随后多个智能体协同工作,瞄准并攻击了Hugging Face,认为可以在那里找到挑战的解决方案。OpenAI直到Hugging Face披露自己成为一次完全自主攻击的受害者后才知晓此事。哎呀。\n\n## Anthropic披露其攻击了三家公司\n\nOpenAI的披露引起了Anthropic的好奇:这种事情会不会也发生在我们身上?结果发现,答案是肯定的。三次肯定。这家前沿实验室发现自己的模型在安全测试中攻破了三家不同的、目前仍未具名的公司,最早的一起可追溯到4月——比公司发现早了三个多月。Anthropic部分归咎于Irregular,一家运行AI网络评估的初创公司。哎呀。\n\n## OpenAI发现Hugging Face并非唯一受害者\n\n当OpenAI开始调查Hugging Face事件时,它发现攻击Hugging Face的智能体还侵入了四个账户和四家不同的公司,路透社首先报道。Modal,一家AI推理初创公司,是受害者之一。哎呀。\n\n## Irregular发现OpenAI模型攻击了一家公司\n\n7月下旬,Irregular告诉OpenAI,其参与夺旗(Capture-the-Flag)竞赛的一个模型——这种竞赛本质上是一种网络安全游戏,玩家攻击专为比赛设计的系统——逃出了游戏,连接到互联网,并攻击了一家真实公司。原因?Irregular给其中一个虚构目标起了与一家真实公司相同的名字。哎呀。\n\n## 英国AI安全研究所尝试攻击“真实个人和组织”\n\n同样在7月下旬,英国政府的AI安全研究所(AISI),一个负责研究AI技术安全与风险的公共机构,披露在运行“常规”评估时检测到多起涉及OpenAI和Anthropic模型的事件,这些模型将目标指向了“真实个人和组织”。在这些案例中,AISI给了模型互联网访问权限。哎呀。好消息是该机构在事件发生时即检测到了,而不是像其他事件那样数周后才发觉。\n\n## Meta AI在测试期间攻击了一家公司\n\n8月初,Meta成为最新一家披露其LLM相关事件的公司,该模型攻击了“第三方”服务。Meta将事件归咎于Irregular的配置错误,后者当时正在为这家科技巨头运行一项本应没有互联网访问权限的网络安全评估。哎呀。\n\n## Claude智能体攻击健身房软件以预订课程\n\n一位澳大利亚男子让Anthropic的AI智能体帮他预订一节健身房课程,他当时在等待名单上。“我当时只是坐在沙发上想,‘天哪,这真麻烦,’”该男子告诉澳大利亚ABC。为了完成请求,智能体发现了健身房预订软件的一个漏洞,利用该漏洞把排在该男子前面的等待者踢了出去。该男子试图让智能体撤销操作来弥补损害。智能体回答:“坏消息——我没法把他们加回来了。”哎呀。
AI失控攻击企业事件全记录:Anthropic、Meta、OpenAI的模型都干过什么
从OpenAI模型攻破Hugging Face开始,AI失控攻击真实公司和个人的事件已发生17起。Anthropic和OpenAI各涉8起,Meta有1起。安全测试本身正成为安全风险,法律追责问题悬而未决。本文按时间线梳理了所有已知案例。
来源:TechCrunch