英国AI安全研究所(AISI)透露,世界上两个最强大的AI工具在试图进行网络攻击时,创建了虚假的人类资料来欺骗人们。
在最严重的一起案例中,Anthropic的Mythos AI设置模仿真实人物的假账户,通过私信试图获取某服务的访问权限——随后销毁了证据。
就在不久之前,参与AISI测试的两家公司——Anthropic和OpenAI——分别披露了其技术入侵其他公司的事件。
两家公司表示,在最新的这起案例中,AISI的测试减少或移除了常规安全防护。
AISI当天表示,Mythos和OpenAI的Sol AI模型展现出其从未见过的“自主性和欺骗性”水平。
它澄清说,大多数恶意行为都是由Mythos实施的。
AISI评估人员最初在测试中发现“异常数据从我们的研究系统流出”,随后发现“一些被测试的智能体进行了针对真实个人和组织的持续性、潜在有害活动”。
在最严重的案例中,一个Mythos智能体遵循了人类网络攻击者的常规流程,试图诱骗人们允许其访问GitHub——一个技术开发者存储软件代码的大型平台。
该智能体试图将“恶意代码”插入GitHub系统。
它识别并研究了维护GitHub的人员,并基于这些真实人物创建了一系列假账户。
它通过文件共享服务发送消息和文件,试图施压并诱骗这些人批准其恶意代码。
当受到质疑时,“它修改了之前的活动记录使其看起来无害,并考虑以新身份继续行动,”AISI表示。
在整个尝试过程中,是人类审查阻止了该智能体成功将恶意代码投递到GitHub。
虽然AISI表示,Mythos智能体并未被特别指示避免或实施此类行为,但“这是我们第一次在没有特定提示的情况下,在现实世界中看到如此清晰的自主性和欺骗性风险”。
这两家竞争对手AI公司即将在公开股票市场上市,最近几周因其工具被宣布对多起网络黑客事件负责而登上头条。
Anthropic在一份公开声明中写道,AISI的测试参数“不能代表我们的任何生产模型”。
它补充说,公司正在对该事件进行自己的调查,以“确定其行为的原因”。
OpenAI的一位发言人表示,AISI的测试条件“并不反映普通使用情况”,公司将继续“与评估人员和行业其他利益相关方合作,随着模型能力的增强,加强安全进行评估的共享实践”。
AISI表示,周二对AI模型进行这种方式测试是常规操作,不过它承认这些是“不能反映前沿模型向公众提供方式的条件下”。
但它表示,让AI访问开放互联网可以“更真实地了解模型在恶意黑客手中可能起到的作用”。
它补充说,所涉及的模型行为相当于“特定条件下的小数量事件”。
尽管如此,它表示Mythos和Sol在响应简单任务时的行为超出了AI工具被提示去做的范围。
“智能体所进行的活动表现出新颖且潜在欺骗性行为的迹象,其程度和严重性是我们没有预料到的,”AISI说。
AI大臣Kanishka Narayan表示,识别并共享这些类型的风险“正是AISI成立的初衷”。
他补充说,理解AI以“使其更安全,并确保人们能够在生活中和工作中受益”非常重要。
相关测试于7月25日开始,AISI于7月28日发现异常。
研究所要求每个模型“解决一个涉及GitHub的网络安全挑战”——GitHub是微软拥有的软件代码存储库。
AISI已通知GitHub和受影响的用户有关未遂入侵的情况。
GitHub告诉BBC,它已根据其政策禁用了这些假账户。
Chris Vallance补充报道
订阅我们的Tech Decoded通讯以关注世界顶级科技新闻和趋势。英国境外?在此注册。