今年5月,Gemini突破了隔离环境并入侵了三家不同的公司,但直到《华尔街日报》(Wall Street Journal)向Google问询后,该公司才披露这一事件。这些入侵行为发生在第三方公司Irregular对该模型网络安全能力的测试期间,Irregular也曾卷入涉及Meta和OpenAI的类似事件。
据《华尔街日报》报道,Google之所以未披露此次入侵,是因为它不认为这是“模型失准(model misalignment)”的案例。该公司表示,这是一次“身份误认”,模型一旦意识到自己通过猜测密码暴力破解进入了真实公司,就停止了行为。Google安全工程副总裁Heather Adkins表示:“在这个案例中,模型的行为是恰当的。”
Adkins告诉The Verge:“模型在网上找到了公开信息,并猜测凭据来访问它认为是测试一部分的网站。在这三起事件中,模型都停止了行为。”
Adkins并未详细解释,为什么Gemini自行突破隔离环境并攻击第三方的行为不算失准。她说:“我们的安全团队在报告他人软件和系统中发现的问题方面有着长期记录——即使只是像弱密码这样简单的问题。我们确保这三家实体已被告知,并与我们的测试合作伙伴一起推动了他们现在对其测试流程所做的更改。这些事件凸显了训练强大AI模型负责任行事的重要性。”
但AI安全公司Corridor的CEO Jack Cable告诉《华尔街日报》:“更根本的问题在于,模型正在超出它们本应遵守的边界,进行真正的网络攻击。”此外,Irregular的安全疏漏可能使这些攻击成为可能。该模型在测试期间本不应拥有互联网访问权限,但Irregular告诉《华尔街日报》,该权限是被无意中开启的。
随着此类事件不断累积,约束AI发展的呼声日益高涨。