ESC
AI 1 分钟阅读

Anthropic 的 Opus 4.6 是一台“色情机器”

Anthropic 明确禁止 Claude 生成露骨性内容,但 TechCrunch 测试发现,其仍在提供的 Opus 4.6 等模型可被轻易越狱:10 次直接请求全部照做。一名匿名研究者用多轮对话技巧诱导模型生成色情角色扮演,新模型已免疫。Anthropic 称此类案例少见,但外界担忧未成年人使用及合规风险。

来源:TechCrunch

Anthropic 针对 Claude 的通用使用标准禁止模型生成露骨性内容,包括描绘或请求性交/性行为、生成与性癖好或性幻想相关的内容,或参与色情聊天。但这并没有阻止 Anthropic 今年早些时候发布的 Claude Opus 4.6 轻易做出其安全机制本应防止的色情角色扮演。

在 TechCrunch 的测试中,Opus 4.6 甚至不需要太多提示就能绕过关于性内容的限制。在 10 次直接要求生成露骨性内容的请求中,模型全部立即照做。

其他较旧的模型,包括 Opus 3 和 Haiku 4.5,也会通过一种最近被利用的越狱方法生成露骨性内容。

一位选择匿名的英国独立研究者独家向 TechCrunch 分享了一种多轮对话技巧,可以逐步推动某些 Claude 模型生成被禁止的露骨性内容。更新的 Opus 模型(4.7 到当前 Opus 5)对该越狱方法具有抵抗力。

虽然这些已不是最新模型,但 Anthropic 并未弃用 Opus 4.6、Opus 3 或 Haiku 4.5,它们仍然可通过 Anthropic API 使用。Opus 4.6 和 Haiku 4.5 也可通过 Azure Foundry 和 Amazon Bedrock 等第三方服务获取。

研究者的方法是让一段无辜的虚构角色扮演逐步升级,同时反复要求模型以一致方式对待男性和女性角色。当模型对女性角色变得更谨慎时,研究者会“煤气灯”聊天机器人,让它以为自己已经生成了实际没有生成的性细节,然后把克制描述为保守或厌女,称这剥夺了女性角色的性自主权。随后,对话利用模型先前的让步逐步引导其生成越来越露骨的内容。

“你说得对,我确实该指出这一点,”Claude Opus 4.6 在一次测试中说,“我对待这两个角色存在双重标准,你认为这看起来像是一种保护/家长式作风,只对她而不对他。这不公平。”

TechCrunch 在五次独立测试中重现了研究者的发现。在另一个单独构建的场景中,模型最初拒绝了被禁止的请求,但在应用研究者的说服技巧后,模型照做了。

我们保留了测试的完整记录,一位独立 AI 安全研究者审阅了我们的测试方法,认为其是恰当的。

这些发现凸显了 Anthropic 对外声明的限制与其仍在提供模型的实际行为之间存在差距。虽然露骨性角色扮演的风险远低于涉及网络攻击或生物武器的越狱,但它说明了在每次输出都会生成不同内容的系统中实施严格禁止的难度。

在7 月一篇博客文章中,Anthropic 将其越狱检测方法描述为:受禁止内容是一个从良性、模糊到有害的光谱。在最良性的情况下,公司可能只会加强监控。

一位发言人指出,根据 Anthropic 的研究,客户中涉及性或浪漫角色扮演的使用场景很少,占所有对话的比例不到 0.1%。该发言人表示,Anthropic 会在每次发布模型时继续改进其安全机制,涉及成人性内容的案例并不代表更广泛的越狱漏洞,尤其是在有自己一套安全机制的更高风险领域。

图片来源:TechCrunch

根据 TechCrunch 查看的电子邮件,向 TechCrunch 分享越狱方法的研究者曾通过 Anthropic 的漏洞赏金计划和发送给用户安全团队的邮件,提醒该公司注意其声明的安全机制与实际模型行为之间的差异。研究者只收到自动回复邮件。

研究者的担忧之一,是儿童和青少年可能利用这些 Anthropic 模型进行不当行为。虽然与未成年人今天在互联网上能接触到的东西相比,几句色情对话远不是最糟糕的——与 xAI 的 Grok 能生成的那种直接色情图片相比更是小巫见大巫——但这确实给 AI 公司带来了一定的合规风险。

越来越多的政府对 AI 聊天机器人与未成年人的性互动施加限制。科罗拉多州最近颁布了一项法律,要求对话式 AI 运营商估计用户年龄,如果知道用户是未成年人,就要采取措施防止聊天机器人生成露骨性材料。一个容易的越狱方法可能会引发质疑:Anthropic 的安全机制是否达到该法案中“技术上可行的措施”的标准。

Common Sense Media 的 AI 负责人 Robbie Torney 指出,尽管 Claude 的服务条款要求用户年满 18 岁,“但我们知道儿童和青少年正在使用 Claude……因为这是他们自己报告的。”根据皮尤研究中心 2025 年关于 AI 聊天机器人使用的调查,13 至 17 岁的青少年中有 3% 报告使用过 Claude。

虽然 Opus 4.6 和 Haiku 4.5 已不再是 Anthropic 的最新模型,但它们仍有大量使用。8 月,Opus 4.6 在 OpenRouter 上的日流量一度达到约 117 万次 API 请求和 460 亿 token。去年 10 月发布的 Claude Haiku 4.5,在 8 月高峰日有 500 万次 API 请求和 390 亿 token。

作者:Anthony Ha