

题图摄于北加州
Opus 5 发布了。在多项公开基准上跑分上,它的性能接近、甚至领先于 Fable 5,API 价格却只有一半,官方定位却低一档。听起来有点像营销的话术,但我感觉 Anthropic 是认真的。Claude Opus 5 最值得讨论的,并不是“又一个最强模型”,而是它把模型分层的逻辑摆到了台面上。
先把情况说清楚一点。Anthropic 在 Frontier-Bench、GDPval-AA 等评测中称 Opus 5 达到新的最佳水平;在 ARC-AGI 3、OSWorld 2.0、AutomationBench 等项目中称其超过“次优模型”,但并未在每一项逐一点名 Fable 5。
结合公开数据与 The New Stack 的解读,Opus 5 在多数已披露对比中均优于 Fable 5;CursorBench 的最高 effort 档位则以约 0.5% 的差距落后。
我觉得问题也因此变得更有意思:既然纸面能力已逼近、甚至局部反超,为什么 Fable 5 仍是 Anthropic 产品矩阵里更高一层的旗舰?答案也许不在一个更长的排行榜,而在于两把完全不同的尺子。
第一把尺子是任务效率:完成度、速度和 token 成本。给定一个代码库或办公流程,谁能以更少调用、更短时间、更高成功率把事情做完,Opus 5 的主战场就在这里。其官方 API 定价为输入 5 美元/百万 token、输出 25 美元/百万 token;Fable 5 官方定价则为输入 10 美元/百万 token、输出 50 美元/百万 token,恰好是前者的两倍。
第二把尺子,我更愿意叫“自主边界”:模型能在什么权限下连续运行多久,在网络安全、生物研究等双重用途任务中,能力会暴露到什么程度。
Reuters 采访中,Anthropic 产品负责人 Dianne Penn 的区分很直接:Opus 5 看重性价比,Fable 5 留给“数天级、非常自主”的项目。
换句话说,通用模型排行榜主要量的是第一把尺子;而第二把尺子——权限、时长、风险暴露面和治理成本,才越来越决定旗舰档位。Fable 5 对应的并不只是更长的任务链,并且是更严的安全与访问安排。
需要说明的是,这是 Anthropic 官方给出的产品分层逻辑。一方面,长程自主任务确实对应更高的安全治理与权限管控成本;另一方面,在跑分差距很小的前提下,用“自主边界”划分档位,也客观上支撑了 Fable 5 的溢价空间。我们不必将其简单归为营销,但也不应完全顺着厂商的框架理解模型的高低之分。
如果说第一把尺子衡量的是任务效率,那么 Opus 5 的效率优势不是单步推理更聪明,而是更强的任务闭环能力。Anthropic 给出的三个案例,恰好把这种能力拆成三个层级。

面对无法直接解析的机械零件图,它没有凭空估算尺寸,而是自行编写计算机视觉管线,从原始像素中提取几何信息、生成 FreeCAD 模型——没有现成工具,就自己造出工具。
面对开源包管理器的真实 bug,它没有停在修复表面报错,而是追溯到社区补丁遗漏的边界条件——不是“暂时能用”,而是根治根因。
面对无实时数据源的交易所行情接口,它不局限于写完代码就交付,而是主动搭建测试 harness(测试框架)校验解析逻辑——没有验证条件,就创造验证条件。
只负责生成答案的模型更像工具:给出答案,任务似乎就结束了;具备自检和验证能力的模型则开始接近协作者:给出答案只是起点,还要继续确认答案能否经得起检验。这正是“会回答”与“会收尾”的区别。
当然,这些都是 Anthropic 自选的典型场景,展示的是能力上限,并不代表所有真实任务都能达到同等完成度,其普适效果仍需企业在自身业务中验证。
应该说,安全部分反而更能说明产品分层不是简单的强或弱。按 Anthropic 基于 OSS-Fuzz 基准开展的内部评测,Opus 5 在漏洞发现上已经接近同系列安全向旗舰 Mythos 5;但在把漏洞发展为可利用攻击手段上,明显落后。

“发现能力接近、利用能力却不接近”,这意味着 Anthropic 尝试把能力区分细化到任务环节:允许源码漏洞发现等防御性用途,却限制二进制漏洞扫描、渗透测试和漏洞利用(exploit)开发。它不是把网络安全整个切掉,而是在决定模型能走到链条的哪一步。
护栏也不再是单纯的拒答开关。Anthropic 预计,Opus 5 的网络安全分类器介入频率比 Fable 5 低约 85%;被拦截的请求可自动降级到 Opus 4.8,而不是直接结束对话。企业买的不是“有没有护栏”,而是护栏调到多紧、被拦下后怎么交接。
这里仍要保留一个关键问号:安全能力的核心价值在于对抗场景,而非静态基准测试。上述数据均来自厂商内部评测,其护栏在真实渗透与绕过尝试中的实际表现,仍有待外部安全社区的检验。
在肯定这些进步的同时,我觉得仍有必要保留一点审慎。模型会自检,不等于验证成本消失。它只是把部分人工复核,换成模型多跑几轮、多调用几次工具、多消耗 token 和时延。
模型多跑几轮、多调用几次工具所增加的 token 和时延成本,相对容易计量;更难量化的是,人类的审核工作会从逐行复审答案本身,转向复审答案的产生过程,这对证据链、日志和审计机制提出了更高要求。

更值得警惕的是,模型说“我已经验证过了”以后,人如何确认它真的验证过?如果团队因此降低警惕、减少必要复核,就会出现自动化依赖或过度信任:模型的自证行为反而可能让人的判断力打折。高价值流程中,人类的审计责任并没有消失,只是转向检查证据链、工具日志、权限边界和异常交接。
所以企业评估 Opus 5 或同类模型时,与其先问“哪个跑分最高”,不如拿团队原本需要人工复核两小时的真实任务做小测试:记录模型用了多少 token、重试几次、留下哪些验证证据,以及最终是否仍要人工介入。这些数据比排行榜更接近采购决策。
Loop Engineering (参见本号文章:Claude Code 真正的革命是循环工程)的核心逻辑,是用多轮自检迭代提高任务成功率。其根本原因是:在模型还不够可靠的前提下,怎样通过工程机制让它开始承担真实任务。
Opus 5 把问题推进了一步:当自检、降级和护栏都被写进产品本身,企业购买的不是更高的 benchmark 分数,而是一条可配置的“能力—成本—风险”曲线,以及出了问题后的降级与交接机制。
如果你的团队准备把智能体放进真实业务流程,你会先问它能答出什么,还是先问它如何证明自己把事收尾了?
参考资料
Anthropic,《Introducing Claude Opus 5》,2026 年 7 月 24 日。
Anthropic / Claude Platform Docs,《Introducing Claude Fable 5 and Claude Mythos 5》。
Reuters,《Anthropic rolls out Opus 5 AI model in efficiency upgrade》,2026 年 7 月 24 日。
The New Stack,《Anthropic's Opus 5 is almost Fable 5》。