Fable 5.1对齐税可量化:两个同源模型的性能差距,揭示AI安全边界的真实代价

2026年9月1日,Anthropic同时推出Claude Fable 5.1和Claude Mythos 5.1。缓存读取成本从每百万tokens $1.00削减至$0.25,降幅75%,Anthropic官方博客披露这将使典型工作负载成本下降约25%,对高频上下文复用的智能体任务最高节省45%。

两个“同一个模型”为何得分不同

Fable 5.1与Mythos 5.1是完全相同的底层模型,区别仅在于安全分类器的层数与强度。据MarkTechPost报道,在Terminal-Bench 4.0编程基准上,Fable 5.1得分55.8%,Mythos 5.1得分60.9%,差距5.1个百分点。

这个差距是安全过滤器的直接成本。Anthropic将它明文写进发布文档,这是一次罕见的诚实披露——主流AI公司通常不愿量化“对齐”究竟耗损了多少能力。现在这个数字第一次出现在公开基准里。

Mythos 5.1的访问被限制在“Project Glasswing”信任访问计划中,仅向通过审核的美国网络安全和生命科学机构开放,目前覆盖约150家机构。生命科学核查项目以邀请制测试版启动,面向需要使用高级生物学推理能力的研究人员。这套双轨结构意味着:同一个最强模型,绝大多数人用的是安全版,而安全版的能力上限比限制版低了可测量的一截。

缓存读取降价的机制逻辑

理解这次降价,需要先理解智能体的运行方式。一个持续运行的代码审查agent,每次调用时都要重新读入数十万tokens的上下文——系统提示、工具定义、历史对话——这些内容在模型第一次处理后会被缓存,后续读取产生“缓存读取”费用。

Anthropic将这一费率从$1.00降至$0.25,相当于缓存成本从基础输入价格的10%降至2.5%。基础输入价格($10/百万tokens)和输出价格($50/百万tokens)维持不变。据VentureBeat报道,Anthropic称该估算基于其内部8月份的实际使用数据。

这不是全线降价,而是精准针对上下文密集型负载。对话型应用、单次问答场景几乎不受影响;反而是长期运行、频繁读取大型上下文的智能体任务获益最大。这个定价调整的方向,清晰表明Anthropic押注智能体是下一阶段主战场。

基准性能:科学研究任务的跃升尤为突出

在Terminal-Bench-Science 0.1——一个测试模型在终端环境中完成科学研究任务能力的基准上,Fable 5.1以52.6%大幅领先:Fable 5为24.7%,Opus 5为29.0%,据MacRumors援引官方数据,OpenAI的GPT-5.6 Sol仅为22.4%。在科学研究智能体能力上,Fable 5.1与最近一代竞品之间存在一道相当宽的沟。

其他基准同样显示规律性提升:CursorBench 3.2.0达到73.4%,Humanity's Last Exam在使用工具时得分65.0%,OSWorld 2.0严格模式41.7%,AutomationBench 31.4%——而Fable 5在该项上仅17.1%。

Anthropic将模型设计为多档“努力程度”可调:在Claude Code中默认为High,在Claude.ai中默认为Medium。官方文档显示,Medium档位下Fable 5.1能以低得多的成本达到接近甚至超越Fable 5 High档的性能。

网络安全边界的重新划定

Anthropic宣布Fable 5.1现在可以用于发现软件漏洞,但不能用于开发利用漏洞的exploit。同时,网络安全场景的误报率降低了60%——此前模型经常把安全研究相关的合法提问标记为危险内容,导致开发者需要大量迂回操作。

这条边界划定背后是一个技术假设:同一个模型,识别漏洞和利用漏洞是否真的可以被分类器可靠切断?Mythos 5.1的存在本身就说明答案是否定的——Anthropic需要用完全不同的访问机制来区分这两种用途,而不能依赖提示层面的约束。

Mythos 5.1的System Card显示,该模型具备“最强网络安全能力”,已在漏洞发现任务上超越主要人类竞争者。这种能力目前被锁在信任访问计划后面,但Anthropic同时开放了Fable 5.1的漏洞发现能力——意味着那道“识别但不利用”的分类器线,正在承受越来越大的压力。

开发者需要注意的三个破坏性变更

据MarkTechPost详细整理,Fable 5.1带来三项会直接影响现有代码的API变更:

  • 强制工具调用被移除:将tool_choice设为anytool将返回400错误,需改用auto加结构化输出替代。
  • 思维链块绑定模型版本:Fable 5.1可以读取旧版模型生成的思维链,但旧版模型无法读取自身的。使用路由器或降级回退的链路,切换模型版本后推理过程会丢失。
  • 编辑历史轮次会使思维链块失效:注入或删除逐轮提示词、在对话中途重建系统提示或工具数组,现在会直接报错。该检查对2026年8月31日起创建的账户强制生效。

这三个变更集中在同一个方向:模型的推理状态变得更有状态性,更难被外部随意篡改。对多步骤智能体框架的影响不可忽视,使用动态上下文注入的应用需要在迁移前仔细测试。

水印与数据留存的制度化

Fable 5.1内置了文本不可见水印,Anthropic同步发布检测API的私人预览版。据MacRumors报道,该API面向EU法律要求的合规机构开放。这意味着AI生成内容的溯源在欧盟不再只是技术可行,而是有了制度承载。

在数据留存侧,Anthropic推出“企业前沿安全措施”(EFS):数据存储在客户完全控制的云基础设施中,而非Anthropic服务器,实现等同于零数据留存的隐私保护,同时维持反对抗滥用能力。该功能将分阶段向企业客户推出,预计今年秋季晚些时候开始。

判断

这次发布有两件事是真实的:性能确实大幅提升,价格调整也是真实可落地的——不是PPT承诺,而是已经反映在API定价页上的账单变化。

但它同时暴露了一个行业尚未解决的结构性问题:当一家公司需要用“同一模型、不同安全层”来服务不同市场,并且能精确量化安全分类器带来的性能损耗时,整个行业关于“安全与能力可以兼得”的叙事就开始松动。Fable 5.1和Mythos 5.1的5.1个百分点差距,是目前最直接的反驳证据。