Claude Fable 5.1 今天凌晨正式发布!
早上起来赶紧实测了一波,这篇文章简单分享一下。
我先去翻了下 Anthropic 给出的 Benchmark,表格里居然直接放了 GPT-5.6 Sol,这波直接不演了。。。
Terminal-Bench 4.0,Fable 5.1 是 55.8%,GPT-5.6 Sol 是 37.3%:

Claude Fable 5.1 官方 Benchmark:与 Fable 5、Opus 5 和 GPT-5.6 Sol 的成绩对比
如果只看这张表,Fable 5.1 已经赢了。
但懂的都懂,新模型数据都很牛叉。而且,这份成绩由 Anthropic 发布,effort、工具和 Agent Harness 一变,数字跟着变。
这次一起发布的还有 Claude Mythos 5.1。两个名字看着像高低配,其实用的是同一个底层模型,主要区别在安全限制。
Fable 5.1[1] 是一般可用的公开版本,可以通过 Claude、Claude Code、API 和部分第三方平台使用。
Mythos 5.1[2] 走可信访问计划,面向经过审核的网络防御方和生命科学研究者,目前只对美国机构开放。

Claude 官方发布 Claude Fable 5.1 与 Claude Mythos 5.1
我先看 Fable 两代之间的差距,这一列最没有水分。Terminal-Bench-Science 从 24.7% 涨到 52.6%,翻了一倍多,Opus 5 停在 29.0%;AutomationBench 从 17.1% 涨到 31.4%,也把 Opus 5 的 26.9% 甩开了。Humanity's Last Exam 不用工具时是 60.9%。
Terminal-Bench 4.0 那一行要分开看。Fable 5.1 是 55.8%,Opus 5 是 52.3%,差距不大;Mythos 5.1 的 60.9% 高出一截,但它和 Fable 用的是同一个底层模型,差的只是安全配置,这个分数不该拿来给 Fable 排座次。
发布当天就有人贴出截图:让 Fable 5.1 给项目写文档,一个请求烧掉 200 美元/月会员一周额度的 38%。

社区用户分享 Claude Fable 5.1 的长任务用量体验
我拿着这张图去对了价格表。输入 10 美元、输出 50 美元每百万 Token,和 Fable 5 一分没动;100 万上下文、12.8 万最大输出也和上一代一样。
降的只有缓存读取,1 美元变 0.25 美元,砍掉 75%。API 单价没涨;订阅额度怎么折算 Fable 的用量,官方没有给公式,这张截图只能说明一次长输出的请求确实很吃额度。

Anthropic 对 Claude Fable 5.1 与 Claude Mythos 5.1 的介绍

Claude Fable 5.1 官方规格:1M 上下文、128K 最大输出、输入 10 美元和输出 50 美元

Claude Fable 5.1 官方价格:缓存读取每百万 Token 0.25 美元
缓存便宜了能省多少?Anthropic 按实际工作负载估算,普通任务总成本约少 25%,工具调用特别密的任务最多约少 45%。前提是 Agent 反复读同一批代码,缓存真的命中;输出 Token 该花多少还是多少。

Claude 官方给出的 Fable 5.1 缓存降价与实际成本变化
effort 这一档我是被 Terminal-Bench-Science 0.1 那张曲线劝住的:effort 从 low 往上调,成绩和单任务成本一起涨,到 max 时平均一个任务接近 40 美元。所以后面的小测试我没把两边开到 max,统一放在 High 档。

Claude Fable 5.1 与 Fable 5 在不同 effort 下的准确率和单任务成本
GPT-5.6 Sol 的 API 单价是输入 4 美元、输出 20 美元。不算缓存,Fable 5.1 两项都是它的 2.5 倍,后面看结果时这笔差价得一起算进去。
Anthropic 这次反复讲长任务,发布页里 Ramp 的案例最能说明他们想强调什么:Fable 5.1 无人值守连续跑了 38 小时,先发现前一次机器学习实验受标签问题干扰,修正数据后启动 6 个并行实验,让任务跑了一整夜,第二天再回来交结果和下一步计划。
MongoDB 给它的任务是做一个复杂原型。模型先把各服务的代码和文档翻了一遍出设计,然后无人值守跑了几个小时写实现,带着验证循环,早上交出一份可视化走查,整个原型大约 3 天完成。Millennium 那边则是一处百万次运行才冒出来一次的崩溃,工程师追了四五年;Fable 5.1 最后顺着 Core Dump 和第三方库的反汇编,定位到供应商库里的 Bug。
这几段都是 Anthropic 发布页引用的客户案例,测试环境各不相同,只能看出他们想卖的是什么:模型愿意跑很久,中途出问题自己接着修。

Anthropic 对 Fable 5.1 长任务、失败恢复、自动测试和视觉检查能力的介绍
愿意跑很久,不等于提示词可以只扔一句“帮我完成”。我去翻了 Fable 5.1 的 Prompt 指南[3],想看它会在哪停住。

Claude Fable 5.1 Prompt 指南列出的任务完成、修改范围和定点编辑问题
指南点了两个坑。一个是改动范围:小改动可能换来整份文件重写,需求没把范围写死,模型还可能顺手扩功能。另一个是长任务里的停顿:跑到一半停在“下一步准备做什么”,等人确认。这两条我都写进了后面测试的提示词,一条是不要加需求之外的功能,一条是授权过的操作直接做完,不要停在下一步建议。
题目是从空目录做一个 React + TypeScript 的“面试排期助手”:面试可以新增、编辑、删除,待面试记录之间要查时间冲突,数据落在 localStorage,冲突逻辑要有自动测试。Fable 5.1 和 GPT-5.6 Sol 都开 High 档,拿到的是同一份提示词,中途我不追加要求,也不帮它们点遗漏。

Claude Fable 5.1 完成的面试排期助手

GPT-5.6 Sol 完成的面试排期助手
两边的测试、TypeScript 检查、Lint 和正式构建都通过了。
只看页面,GPT-5.6 Sol 做得更精致;看整个工程,Fable 5.1 更扎实:它写了 3 个测试文件、32 个用例,除了时间冲突,还测了筛选、localStorage 和异常数据。Sol 是 1 个测试文件、7 个用例。
所以这轮我把票投给 Fable 5.1。篇幅有限,完整的耗时、交互和代码对比,后续再单独写一篇。
我这次直接在 Cursor 里用。打开设置里的 Models,在模型列表中启用 Claude Fable 5.1,随后就能在 Agent 的模型选择器里切换。我的列表里 Fable 5.1 和 GPT-5.6 Sol 都能选,刚好可以共用同一套测试环境。
Cursor 官方也专门发了一条,称 Fable 5.1 在 CursorBench 3.2 的 max effort 下拿到 73.4%,并特别提到它会主动验证自己的工作。

Cursor 官方宣布支持 Claude Fable 5.1

Cursor Models 中启用 Claude Fable 5.1
如果通过 API 调用,对应的模型 ID 是:
claude-fable-5-1

如果走 Claude Code,还有大佬分享用 CLAUDE_CODE_DISABLE_1M_CONTEXT=1 关闭 1M 上下文,希望少消耗一些 Token。

社区用户分享在 Claude Code 中关闭 1M 上下文的配置
对了,我稳重分享的这道测试题算不上长任务,因为我本身第一次想做难一点,但是我的 Cursor 额度可能不够,毕竟就是 20 美元的档位。
Anthropic 主推的那种几小时、几十小时无人值守。
比较理想的状态是,把任务拉到能跑过夜的长度,两边照旧同一份提示词,耗时、账单和中途停顿一起记。
参考资料
[1]
Fable 5.1: https://www.anthropic.com/claude/fable
[2]
Mythos 5.1: https://www.anthropic.com/claude/mythos
[3]
Fable 5.1 的 Prompt 指南: https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5-1