Anthropic的旗舰模型Fable 5,在"安全暂停—全球恢复—延长免费"的曲折路径上,又走了一步。
7月12日晚,Anthropic宣布将其旗舰Fable 5模型在所有付费订阅计划中的访问时间从原定7月12日延长至7月19日,Claude Code每周速率限额同步保持50%提升一周。Fable 5使用量仍按不超过订阅用户每周限额50%的比例计入免费额度,额度用尽或窗口期结束后将自动切换至usage-based按credits计费。
此次延期发生在Fable 5回归全球访问的关键节点:6月9日发布的Fable 5作为Anthropic新"Mythos"层级的核心模型,发布三天后即因安全原因被美国政府暂停全球分发,暂停持续19天,7月1日管控解除后全球访问恢复,50%每周限额原定7月7日到期被先后推迟至7月12日、7月19日。
安全背景: 延期背景是OpenAI GPT-5.6系列上周正式GA发布,早期基准测试显示在编程和推理任务上正逼近甚至部分超越Fable 5。Anthropic延长访问,既是为了留住正在测试的开发者,也因为Fable 5的发布并不顺遂。6月12日起的全球暂停,公开原因是亚马逊研究员发现安全护栏存在可被绕过的问题,美国政府随后暂停全球分发。Anthropic将此事称为常规防御性网络安全工作中的边缘情况,而不是灾难性能力鸿沟。
公开结论到此为止:Fable 5、Claude Opus 4.8、GPT-5.5、Kimi K2.7以及更小的Claude Haiku 4.5都被指向同类问题。新训练的安全分类器在超过99%的尝试中拦住了亚马逊指出的那类绕过,代价是无害编码请求的误报上升。用户抱怨模型从发布初期就偏严,延期之后更严。Anthropic自己的图表显示,Fable 5的安全边际宽于标准护栏。
后续路线: Anthropic坦承"可能不可能让任何AI模型对越狱完全免疫",正与亚马逊、微软、谷歌及其他Glasswing合作伙伴开发行业标准评级与响应框架。Mythos 5作为同基模型的不受限版本仍被锁定,仅6月26日获政府批准的一小批美国组织可通过Project Glasswing进行网络安全工作访问,Anthropic表示未来几周内将向所有客户开放Mythos级模型(待额外网络安全防护到位),并预告"许多Opus级能力"的更便宜模型即将到来。AWS、Google Cloud、Microsoft Foundry上的Fable 5访问将"尽快"恢复但未给出具体日期。
Claude Reflect作为仪表盘产品同步发布Beta版,帮助用户审视AI使用模式,由Anthropic健康政策负责人Ryn Linthicum主导,与MIT Media Lab、Boston Children's Hospital Digital Wellness Lab、Family Online Safety Institute合作开发——这是Anthropic在AI福祉与"反思型使用"方向的差异化尝试。