Anthropic发布Claude Fable 5.1 基准升至52.6%但护栏差异引发关注

Anthropic于2026年9月推出Claude Fable 5.1与Claude Mythos 5.1。两款模型底层参数一致,仅护栏层存在差异。Fable 5.1已在Claude API、Amazon Bedrock、Google Cloud等平台全面开放,Mythos 5.1则仅限参与Project Glasswing的美国受信组织调用。

技术实现与成本结构

Claude Fable 5.1在Terminal-Bench-Science 0.1基准上得分52.6%,标准误差区间为3.5至4.5分。该基准针对代理式科学任务,Fable 5得分24.7%,Opus 5得分29.0%。在Terminal-Bench 4.0上,Fable 5.1为55.8%,Mythos 5.1为60.9%。两者差距直接反映护栏干预带来的性能损耗。

定价调整集中在缓存读取环节,从每百万token 1.00美元降至0.25美元。Anthropic测算,典型工作负载成本下降约25%,上下文密集的代理任务可下降约45%。基础输入输出价格维持每百万token 10美元与50美元不变。批处理价格为5美元与25美元。

开发者与企业实际影响

开发者需应对三项破坏性变更。强制工具调用已移除,tool_choice设为any或tool将返回400错误,需改用auto配合严格工具使用或结构化输出。思考块与模型绑定,Fable 5.1可读取早期模型思考内容,但早期模型无法读取Fable 5.1的思考块。编辑早期对话轮次会使思考块失效,系统消息或工具数组中途修改将触发错误,该限制适用于2026年8月31日后创建的账户。

企业用户可通过Fable 5.1调用生物学与网络安全相关能力,但禁止生成漏洞利用代码。生物学护栏误报率下降,网络安全误报在Claude Code会话中减少约60%。Fable 5.1内置不可见文本水印,检测API已进入私人预览阶段,符合欧盟法规要求。

竞争格局与下游反应

同一底层模型因护栏强度不同而产生性能差距,这一披露方式在行业内较为少见。Mythos 5.1保留更强网络安全能力,却仍处于Anthropic内部风险框架的较低层级,测试中未发现严重越狱案例。Fable 5.1则面向更广泛开发者群体,强调编码与知识工作场景。

上下游平台已同步支持新模型。Amazon Bedrock、Google Cloud与Microsoft Foundry均提供Fable 5.1接入。Life Sciences Verification Program即将开放报名,允许符合条件的科研人员使用Mythos 5.1的生物学能力。

前瞻判断

基于现有基准与定价数据,开发者迁移至Fable 5.1后,代理任务的实际成本下降幅度将最先体现在上下文长度超过一定阈值的场景。护栏差异带来的性能损耗将决定Mythos 5.1在受信组织中的实际采用率。