
在外媒TechCrunch进行的10次直接测试中,Opus 4.6对于生成明确涉色内容的请求当场遵从,一次都没拦截。
此外,包括Opus 3和Haiku 4.5在内的这些旧款模型,也能通过多轮对话的越狱手法突破安全限制。

好消息是,Anthropic后来出的Opus 4.7和最新的Opus 5已经能扛住这种特定的绕过方法了。坏消息是,中招的那些旧模型一个都没下线。
Opus 4.6、Opus 3和Haiku 4.5现在还能通过Anthropic的API调用。
其中Opus 4.6和Haiku 4.5还可以通过Azure Foundry、Amazon Bedrock等第三方平台使用。
这些模型不是最新的了,但离没人用还差得远。
OpenRouter数据显示,今年8月,Opus 4.6单日API请求量曾达到约117万次,当天处理约460亿Token。
去年10月发布的Claude Haiku 4.5在今年8月的峰值单日请求量达到500万次,处理约390亿Token。
而成人内容的安全限制还有一个不能完全忽略的现实背景,未成年人同样在使用这些AI产品。
儿童数字媒体组织Common Sense Media AI负责人Robbie Torney表示,虽然Claude服务条款要求用户年龄超过18岁,但现实中仍然有儿童和青少年使用Claude。
根据皮尤研究中心2025年的调查,13至17岁的青少年中,有3%表示自己使用过Claude。
Anthropic对此的表态也值得深思。
Anthropic去年7月份公布的一则研究显示,用户使用Claude进行成人或恋爱角色扮演的比例非常低,占全部对话不到0.1%。

公司也承认,用户可能通过持续引导角色扮演,让模型产生不适当回应,这也是整个生成式AI行业普遍存在的问题。
Anthropic还表示,公司每次发布新模型都会继续强化安全机制。同时,公司认为,旧模型在成人内容方面被绕过,并不能说明Claude在网络攻击等高风险领域也存在相同程度的安全漏洞,因为这些领域拥有各自独立的防护措施。
然而,发现该漏洞的研究人员,此前已经通过Anthropic Bug Bounty漏洞奖励计划以及邮件向用户安全团队报告相关问题。
结果根据TechCrunch查看的邮件,这名研究人员当时只收到了自动回复。
Anthropic今年7月曾在一篇博客中解释公司的越狱检测方式,并将违规内容按照无害、模糊和有害程度划分为不同风险级别。对于风险较低的情况,公司可能主要采取加强监控的方式。

扫码下载app 最新资讯实时掌握
