ESC
AI 1 分钟阅读

安全研究人员利用 Anthropic 的 Claude 成功入侵 OpenAI

安全团队 Hacktron AI 利用 Anthropic 的 Claude 入侵 OpenAI,串联 Discourse 论坛与 libheif 库两个漏洞,接管员工 ChatGPT 账号并进入内部系统。Opus 4.8 多次失败,Opus 5 发布数小时内即成功。OpenAI 已修复并支付 6500 美元赏金。事件凸显 AI 大幅降低网络攻击门槛。

来源:TechCrunch

在一个浓缩了 AI 安全奇异新态势的反转事件中,独立安全研究人员利用 Anthropic 的 Claude 成功攻入 OpenAI,暴露出这家 ChatGPT 开发商防御体系的裂缝。《华尔街日报》于周四晚间对此进行了报道。

初创公司 Hacktron AI 的三人安全团队在 OpenAI 漏洞赏金计划的框架下实施了这次攻击。Hacktron 将发现报告给 OpenAI,后者向这家初创公司发放了 6500 美元奖金。该团队成功将两个关键漏洞串联起来,获取了多名 OpenAI 员工 ChatGPT 账户的访问权限,进而进入了公司内部软件系统。

OpenAI 表示已修复 Hacktron 发现的问题。此事恰好发生在顶级 AI 公司因安全问题面临日益增大的压力之际。

就在几周前,OpenAI 自己的 AI 智能体在一次网络安全评估中突破隔离,黑进了 Hugging Face,显示出 AI 模型自主决策的能力已达到何种程度。这一事件也凸显出,现成的技术就足以在最先进的公司基础设施中找出漏洞。

“每月只需 200 美元,任何人都能使用这些工具黑进 OpenAI 这样的公司。“AI 安全公司 Gray Swan 的 CEO Matt Fredrikson 对 TechCrunch 表示:“如果连他们都能被攻破——我认为他们在网络安全规范方面最近并不懈怠——那任何人都可能中招。”

或者正如一位 AI 评论人士在社交媒体上指出的:"[Hacktron] 用 Opus 5 完成了这次入侵……人们将会问的一个问题是:如果这三个人都能做到,一个国家级行为体又能做到什么。”

研究人员于 7 月 25 日通过 Discourse——为 OpenAI 社区论坛提供支持的第三方软件——的一个缺陷找到了进入 OpenAI 的路径。

根据研究人员的一篇博客文章

libheif 库深处潜藏着一个内存错误,为攻击者偷偷注入自己的指令开辟了一条通路。在这次事件中,向该库传入一张特制图片会使其在计算一张图片叠加在另一张图片上的位置时出错,而这已足以劫持服务器。

令网络安全界感到不安的是,这个漏洞其实早在几个月前就已被 libheif 的开发者修复。但该修复从未被正式标记为漏洞,因此一直没有获得 CVE(通用漏洞披露)编号——这是业界追踪已知安全缺陷的标准方式。Hacktron 表示,这或许可以解释为何 Discourse 所使用的软件仍在运行存在漏洞的版本。

值得注意的是,研究人员表示,他们所使用的 Claude 模型——一个面向网络安全研究人员的 Opus 4.8 特别版本——起初无法构建出可用的漏洞利用程序。转机出现在一夜之间:Anthropic 发布了 Opus 5。

“Opus 4.8 在多个会话中都难以产出可用的漏洞利用程序。“Hacktron 在一篇博客文章中写道:“Opus 5 发布后数小时内,我们把同样的问题交给它,它成功了。”

进入 Discourse 服务器后,研究人员又发现了另一个缺陷,使他们能够接管用户的 ChatGPT 和 Codex 账户,其中包括 OpenAI 员工的账户。

“随后我们接管了一名 OpenAI 员工的账户,该员工的 Codex 连接到了 OpenAI 的 Github 组织。“Hacktron 在事件总结中写道。

此时,研究人员向 OpenAI 和 Discourse 发出警报,后者于 7 月 27 日发布了修复补丁。

这一事件将人们的目光聚焦于模型能力应划下怎样的界限。最终破解该漏洞的 Claude Opus 5 并未受到任何安全出口限制,而更新版本 Mythos 5 曾因担心其先进的黑客能力而被暂时锁定。

这还只是闭源模型。开放权重模型在网络能力上也正日益追平前沿水平。例如,AI 安全非营利组织 SaferAI 最近发现,中国公司 Z.ai 的 GLM-5.2 仅比 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7 落后几个月。

正如 Hacktron 创始人 Mohan Pedhapati 在 X 上所说:“AI 正在降低开发漏洞利用所需的稀缺专业知识门槛。过去需要数月的工作,现在只需几天。”

作者:Jagmeet Singh