首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Claude Fable 5.1 正式发布!夯爆了还是拉完了?

Claude Fable 5.1 正式发布!夯爆了还是拉完了?

作者头像
豆芽菜小萌
发布2026-09-04 12:59:35
发布2026-09-04 12:59:35
90
举报

Claude Fable 5.1 今天凌晨正式发布!

早上起来赶紧实测了一波,这篇文章简单分享一下。

我先去翻了下 Anthropic 给出的 Benchmark,表格里居然直接放了 GPT-5.6 Sol,这波直接不演了。。。

Terminal-Bench 4.0,Fable 5.1 是 55.8%,GPT-5.6 Sol 是 37.3%:

Claude Fable 5.1 官方 Benchmark:与 Fable 5、Opus 5 和 GPT-5.6 Sol 的成绩对比
Claude Fable 5.1 官方 Benchmark:与 Fable 5、Opus 5 和 GPT-5.6 Sol 的成绩对比

Claude Fable 5.1 官方 Benchmark:与 Fable 5、Opus 5 和 GPT-5.6 Sol 的成绩对比

如果只看这张表,Fable 5.1 已经赢了。

但懂的都懂,新模型数据都很牛叉。而且,这份成绩由 Anthropic 发布,effort、工具和 Agent Harness 一变,数字跟着变。

Fable 5.1 和 Mythos 5.1 有什么差别

这次一起发布的还有 Claude Mythos 5.1。两个名字看着像高低配,其实用的是同一个底层模型,主要区别在安全限制。

Fable 5.1[1] 是一般可用的公开版本,可以通过 Claude、Claude Code、API 和部分第三方平台使用。

Mythos 5.1[2] 走可信访问计划,面向经过审核的网络防御方和生命科学研究者,目前只对美国机构开放。

Claude 官方发布 Claude Fable 5.1 与 Claude Mythos 5.1
Claude 官方发布 Claude Fable 5.1 与 Claude Mythos 5.1

Claude 官方发布 Claude Fable 5.1 与 Claude Mythos 5.1

涨幅有点夸张

我先看 Fable 两代之间的差距,这一列最没有水分。Terminal-Bench-Science 从 24.7% 涨到 52.6%,翻了一倍多,Opus 5 停在 29.0%;AutomationBench 从 17.1% 涨到 31.4%,也把 Opus 5 的 26.9% 甩开了。Humanity's Last Exam 不用工具时是 60.9%。

Terminal-Bench 4.0 那一行要分开看。Fable 5.1 是 55.8%,Opus 5 是 52.3%,差距不大;Mythos 5.1 的 60.9% 高出一截,但它和 Fable 用的是同一个底层模型,差的只是安全配置,这个分数不该拿来给 Fable 排座次。

贵还是贵,缓存便宜了

发布当天就有人贴出截图:让 Fable 5.1 给项目写文档,一个请求烧掉 200 美元/月会员一周额度的 38%。

社区用户分享 Claude Fable 5.1 的长任务用量体验
社区用户分享 Claude Fable 5.1 的长任务用量体验

社区用户分享 Claude Fable 5.1 的长任务用量体验

我拿着这张图去对了价格表。输入 10 美元、输出 50 美元每百万 Token,和 Fable 5 一分没动;100 万上下文、12.8 万最大输出也和上一代一样。

降的只有缓存读取,1 美元变 0.25 美元,砍掉 75%。API 单价没涨;订阅额度怎么折算 Fable 的用量,官方没有给公式,这张截图只能说明一次长输出的请求确实很吃额度。

Anthropic 对 Claude Fable 5.1 与 Claude Mythos 5.1 的介绍
Anthropic 对 Claude Fable 5.1 与 Claude Mythos 5.1 的介绍

Anthropic 对 Claude Fable 5.1 与 Claude Mythos 5.1 的介绍

Claude Fable 5.1 官方规格:1M 上下文、128K 最大输出、输入 10 美元和输出 50 美元
Claude Fable 5.1 官方规格:1M 上下文、128K 最大输出、输入 10 美元和输出 50 美元

Claude Fable 5.1 官方规格:1M 上下文、128K 最大输出、输入 10 美元和输出 50 美元

Claude Fable 5.1 官方价格:缓存读取每百万 Token 0.25 美元
Claude Fable 5.1 官方价格:缓存读取每百万 Token 0.25 美元

Claude Fable 5.1 官方价格:缓存读取每百万 Token 0.25 美元

缓存便宜了能省多少?Anthropic 按实际工作负载估算,普通任务总成本约少 25%,工具调用特别密的任务最多约少 45%。前提是 Agent 反复读同一批代码,缓存真的命中;输出 Token 该花多少还是多少。

Claude 官方给出的 Fable 5.1 缓存降价与实际成本变化
Claude 官方给出的 Fable 5.1 缓存降价与实际成本变化

Claude 官方给出的 Fable 5.1 缓存降价与实际成本变化

effort 这一档我是被 Terminal-Bench-Science 0.1 那张曲线劝住的:effort 从 low 往上调,成绩和单任务成本一起涨,到 max 时平均一个任务接近 40 美元。所以后面的小测试我没把两边开到 max,统一放在 High 档。

Claude Fable 5.1 与 Fable 5 在不同 effort 下的准确率和单任务成本
Claude Fable 5.1 与 Fable 5 在不同 effort 下的准确率和单任务成本

Claude Fable 5.1 与 Fable 5 在不同 effort 下的准确率和单任务成本

GPT-5.6 Sol 的 API 单价是输入 4 美元、输出 20 美元。不算缓存,Fable 5.1 两项都是它的 2.5 倍,后面看结果时这笔差价得一起算进去。

长任务案例分享

Anthropic 这次反复讲长任务,发布页里 Ramp 的案例最能说明他们想强调什么:Fable 5.1 无人值守连续跑了 38 小时,先发现前一次机器学习实验受标签问题干扰,修正数据后启动 6 个并行实验,让任务跑了一整夜,第二天再回来交结果和下一步计划。

MongoDB 给它的任务是做一个复杂原型。模型先把各服务的代码和文档翻了一遍出设计,然后无人值守跑了几个小时写实现,带着验证循环,早上交出一份可视化走查,整个原型大约 3 天完成。Millennium 那边则是一处百万次运行才冒出来一次的崩溃,工程师追了四五年;Fable 5.1 最后顺着 Core Dump 和第三方库的反汇编,定位到供应商库里的 Bug。

这几段都是 Anthropic 发布页引用的客户案例,测试环境各不相同,只能看出他们想卖的是什么:模型愿意跑很久,中途出问题自己接着修。

Anthropic 对 Fable 5.1 长任务、失败恢复、自动测试和视觉检查能力的介绍
Anthropic 对 Fable 5.1 长任务、失败恢复、自动测试和视觉检查能力的介绍

Anthropic 对 Fable 5.1 长任务、失败恢复、自动测试和视觉检查能力的介绍

愿意跑很久,不等于提示词可以只扔一句“帮我完成”。我去翻了 Fable 5.1 的 Prompt 指南[3],想看它会在哪停住。

Claude Fable 5.1 Prompt 指南列出的任务完成、修改范围和定点编辑问题
Claude Fable 5.1 Prompt 指南列出的任务完成、修改范围和定点编辑问题

Claude Fable 5.1 Prompt 指南列出的任务完成、修改范围和定点编辑问题

指南点了两个坑。一个是改动范围:小改动可能换来整份文件重写,需求没把范围写死,模型还可能顺手扩功能。另一个是长任务里的停顿:跑到一半停在“下一步准备做什么”,等人确认。这两条我都写进了后面测试的提示词,一条是不要加需求之外的功能,一条是授权过的操作直接做完,不要停在下一步建议。

顺手跑个小测试

题目是从空目录做一个 React + TypeScript 的“面试排期助手”:面试可以新增、编辑、删除,待面试记录之间要查时间冲突,数据落在 localStorage,冲突逻辑要有自动测试。Fable 5.1 和 GPT-5.6 Sol 都开 High 档,拿到的是同一份提示词,中途我不追加要求,也不帮它们点遗漏。

Claude Fable 5.1 完成的面试排期助手
Claude Fable 5.1 完成的面试排期助手

Claude Fable 5.1 完成的面试排期助手

GPT-5.6 Sol 完成的面试排期助手
GPT-5.6 Sol 完成的面试排期助手

GPT-5.6 Sol 完成的面试排期助手

两边的测试、TypeScript 检查、Lint 和正式构建都通过了。

只看页面,GPT-5.6 Sol 做得更精致;看整个工程,Fable 5.1 更扎实:它写了 3 个测试文件、32 个用例,除了时间冲突,还测了筛选、localStorage 和异常数据。Sol 是 1 个测试文件、7 个用例。

所以这轮我把票投给 Fable 5.1。篇幅有限,完整的耗时、交互和代码对比,后续再单独写一篇。

Fable 5.1 目前怎么用

我这次直接在 Cursor 里用。打开设置里的 Models,在模型列表中启用 Claude Fable 5.1,随后就能在 Agent 的模型选择器里切换。我的列表里 Fable 5.1 和 GPT-5.6 Sol 都能选,刚好可以共用同一套测试环境。

Cursor 官方也专门发了一条,称 Fable 5.1 在 CursorBench 3.2 的 max effort 下拿到 73.4%,并特别提到它会主动验证自己的工作。

Cursor 官方宣布支持 Claude Fable 5.1
Cursor 官方宣布支持 Claude Fable 5.1

Cursor 官方宣布支持 Claude Fable 5.1

Cursor Models 中启用 Claude Fable 5.1
Cursor Models 中启用 Claude Fable 5.1

Cursor Models 中启用 Claude Fable 5.1

如果通过 API 调用,对应的模型 ID 是:

代码语言:javascript
复制
claude-fable-5-1

如果走 Claude Code,还有大佬分享用 CLAUDE_CODE_DISABLE_1M_CONTEXT=1 关闭 1M 上下文,希望少消耗一些 Token。

社区用户分享在 Claude Code 中关闭 1M 上下文的配置
社区用户分享在 Claude Code 中关闭 1M 上下文的配置

社区用户分享在 Claude Code 中关闭 1M 上下文的配置

总结

对了,我稳重分享的这道测试题算不上长任务,因为我本身第一次想做难一点,但是我的 Cursor 额度可能不够,毕竟就是 20 美元的档位。

Anthropic 主推的那种几小时、几十小时无人值守。

比较理想的状态是,把任务拉到能跑过夜的长度,两边照旧同一份提示词,耗时、账单和中途停顿一起记。

参考资料

[1]

Fable 5.1: https://www.anthropic.com/claude/fable

[2]

Mythos 5.1: https://www.anthropic.com/claude/mythos

[3]

Fable 5.1 的 Prompt 指南: https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5-1

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-09-02,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • Fable 5.1 和 Mythos 5.1 有什么差别
  • 涨幅有点夸张
  • 贵还是贵,缓存便宜了
  • 长任务案例分享
  • 顺手跑个小测试
  • Fable 5.1 目前怎么用
  • 总结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档