Claude Fable 5.1:换一把尺子才登顶的长时程 agentic 档
claude-fable-5-1
Anthropic 面向 demanding reasoning and long-horizon agentic work 的固定版本(claude-fable-5-1,退役不早于 2027-09-01):默认思考强度 high、$10/$50,是同门 Opus 5.5 的 2.5 倍,默认 high 即默认成本行为。地位靠换尺子才成立:Arena Agent 净改进第 1(13.71,confirmed_success 19.83、praise 31.83),第 2 是 GPT-6 Astra(11.54/17.70/32.79),Opus 5.5 未进前八;Terminal-Bench 4.0 第 2、57.88%(n=330),比榜首 Astra 的 58.18% 低 0.3 点,而 pass@5 0.7879 高于其 0.7121,单次略低、五次更稳;智能指数 max 档 53.35 排第 4。画像一致:复合智能非第一,把真实任务往前推进是第一。praise 单列说明该榜含人评成分,非客观基准。选型看负载难在推理还是长程。闭源只走 API。置信度 A(已确认);未在自有 harness 上跑长任务对照。
- 置信度
- 已确认
- ≥2 个独立来源,或本站 harness 复现通过
- 关键指标
- Arena Agent 净改进
- 已确认 · 2026-09
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 A 档(已确认):Anthropic 官方文档给规格与本站同步的三张第三方榜给读数,两者独立。但 A 档只保证「数字是真的」,不保证「这些数字在你的负载上同向」——尤其 Arena Agent 是人评/裁判评协议,
praise列的存在已经说明它含主观成分。它最值得记的一点是换尺子才登顶。同一代同一个厂商的两个模型,在智能指数上 Opus 5.5 领先 Fable 5.1 达 4.27 分,在 Agent 榜上 Fable 5.1 领先到 Opus 5.5 根本不在前八。这不是矛盾,是这两个榜量的东西不同:一个是复合智能,一个是长时程任务推进。我们的判断是——对要把 agent 放进真实工作流的人,后者更接近生产真相,所以我们把它列为推理域梯顶的第二条,而不是因为它的绝对分数最高。
Terminal-Bench 上那组对照特别有信息量:单次准确率 57.88% 比榜首低 0.3 个百分点,pass@5 却是 0.7879 对 0.7121。这说明它的失败是可重试的失败(差一点、换个路径就过),而不是系统性走偏。在 agent 流水线里,可重试的失败远比不可重试的失败便宜——因为重试是自动的,走偏要人来兜。硬边界:贵,而且默认档就贵;智能指数不是第一,评测口径选错就会买错;闭源、数据出域。
它解决的问题:把「推进一个真实任务」当成独立的优化目标
大多数模型排行榜量的是回答质量:给一个问题,答得对不对、好不好。Claude Fable 5.1 瞄准的是另一件事,官方定位原文是 demanding reasoning and long-horizon agentic work(高要求的推理与长时程的 agentic 工作)。翻译过来就是:它优化的不是「这一轮说得多漂亮」,而是「一个真实任务被交给它之后,结果向前走了多少」。
这个区别在生产里是真金白银。一个编码 agent 跑两小时,中间要读代码、改代码、跑测试、看报错、再改,几十轮下来最终的 diff 能不能合入,和它每一轮回答的文采几乎没有关系。真正决定成败的是长时程一致性:目标有没有漂移、上一步的假设有没有被记住、失败之后是不是在同一个坑里反复摔。
官方规格
| 维度 | 官方读数 | 与 Opus 5.5 的差异 |
|---|---|---|
| API ID | claude-fable-5-1 | 同代不同定位的两个固定版本 |
| 官方定位 | demanding reasoning and long-horizon agentic work | Opus 5.5 是 long-running agentic coding and knowledge work |
| 默认思考强度 | high | Opus 5.5 默认 medium;这是两者最实质的默认行为差 |
| 价格 | $10 输入 / $50 输出 | Opus 5.5 是 $4 / $20,即 Fable 贵 2.5 倍 |
| 退役承诺 | 不早于 2027-09-01 | 比 Opus 5.5 早三周,但同样是 12 个月级窗口 |
「默认 high」这一行值得单独说。它不是营销措辞,而是默认成本行为:开箱即用的 Fable 5.1 每次调用都比 Opus 5.5 默认档烧更多思考 token。所以选它之前要先确认你的任务确实需要这个强度,否则你付的是 2.5 倍单价乘以更高的思考消耗。
第三方水位:它在 Agent 榜第一,在智能指数不是
把两个榜摆在一起看,才能理解这个模型的定位——它是换了一把尺子之后才登顶的:
- Arena Agent 榜(净改进):第 1 名 Claude Fable 5.1 (Max),
net_improvement13.71、confirmed_success19.83、praise31.83。第 2 名是 GPT 6 Astra (Max) 11.54 / 17.70 / 32.79。第 3、4 名是 Claude Opus 5 的 high 与 max 档(10.25 / 10.16),第 5 名 Claude Fable 5 (High) 8.81。Opus 5.5 没有出现在这个榜的前八名里。 - Artificial Analysis 智能指数:Fable 5.1 max 档 53.35 排第 4、xhigh 档 53.20 排第 5;低于 Opus 5.5 的 57.62 / 55.99 / 53.58(第 1、2、3 名)。
- Terminal-Bench 4.0:Fable 5.1 第 2,准确率 57.88%(n=330),与榜首 GPT-6 Astra 的 58.18% 只差 0.3 个百分点;但它的
pass@5是 0.7879,高于 Astra 的 0.7121。也就是说单次准确率略低,给五次机会的通过率反而更高。
这三组读数拼出来的画像很一致:在「复合智能」这把尺子上它不是第一,在「长时程把任务推进」这把尺子上它是第一,在「终端里完成真实工程任务」上它和榜首几乎并列、而且重试鲁棒性更好。对要把 agent 放进真实工作流的人,后两把尺子比第一把更相关。
net_improvement 与 confirmed_success 这两个字段本身的语义也要讲清:前者量的是相对基线的净推进幅度(做坏了要扣分),后者是被确认成功的比例。Fable 5.1 的 13.71 与 19.83 同时高于 Astra 的 11.54 与 17.70,但 Astra 的 praise(32.79)反而更高——「看起来做得好」和「确实推进了」在这个榜上是分开的两列,这正是这个榜比问答榜有价值的原因。
什么负载该选它
- 该选:长时间自主运行的编码任务、需要跨几十个文件保持一致性的重构、要求「跑完就交结果」而不是「每步等人确认」的 agent 流水线。
- 不该选:高并发的短问答、成本敏感的批处理、可以人工分步把关的工作流——这些场景 Opus 5.5 默认档就够,而且便宜 2.5 倍。
- 要实测再定:你的任务到底是「难在推理」还是「难在长程一致」。前者智能指数更相关(Opus 5.5 更高),后者 Agent 榜更相关(Fable 5.1 更高)。判断错方向的代价是既多花钱又没变好。
边界
- 贵,而且默认就贵:$10/$50 加上默认 high 思考强度,单位任务成本可能是同代主力档的三倍以上。反复抽卡式的 agent 循环会把这个倍数放大。
- 智能指数不是第一:如果你的评测口径是复合智能而不是任务推进,选它是错的,Opus 5.5 的 max 档高 4.27 分。
- Arena Agent 是人评/裁判评协议:
praise这一列的存在说明有主观评分成分,净改进再硬也带一层评价者偏差,不能当成客观基准读。 - 闭源、只走 API:不能自托管、不能微调、数据出域。
我们的核验状态
事实来自两个独立来源:Anthropic 官方模型文档(platform.claude.com models overview,实读定位、默认思考强度、定价、退役日期)与本站同步的 Arena Agent、Artificial Analysis 智能指数、Terminal-Bench 4.0 三张榜的原始行(抓取 2026-09-22,字段名与读数逐字对齐)。官方文档与第三方榜单相互独立,因此置信度记 A(已确认)。
A 档的边界仍然要说清:我们未做能力复现。没有在自有 harness 上跑过 Fable 5.1 与 Opus 5.5 / GPT-6 Astra 的长任务对照,没有验证 Arena Agent 的 net_improvement 在我们的负载上是否同向,也没有实测默认 high 档的真实 token 消耗。本页「什么负载该选它」那一节是基于榜单语义的推断,不是我们的实测结论。要把它升到实测级,需要:同一批真实任务在三个模型上的净推进对照、默认档与 high 档的成本-效果曲线、以及重试鲁棒性(pass@5)在自有任务集上的复算。