首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >从会回答到会收尾:Claude Opus 5 想解决的,不只是智商问题

从会回答到会收尾:Claude Opus 5 想解决的,不只是智商问题

作者头像
Henry Zhang
发布2026-07-27 21:08:07
发布2026-07-27 21:08:07
1680
举报

题图摄于北加州

Opus 5 发布了。在多项公开基准上跑分上,它的性能接近、甚至领先于 Fable 5,API 价格却只有一半,官方定位却低一档。听起来有点像营销的话术,但我感觉 Anthropic 是认真的。Claude Opus 5 最值得讨论的,并不是“又一个最强模型”,而是它把模型分层的逻辑摆到了台面上。

先把情况说清楚一点。Anthropic 在 Frontier-Bench、GDPval-AA 等评测中称 Opus 5 达到新的最佳水平;在 ARC-AGI 3、OSWorld 2.0、AutomationBench 等项目中称其超过“次优模型”,但并未在每一项逐一点名 Fable 5。

结合公开数据与 The New Stack 的解读,Opus 5 在多数已披露对比中均优于 Fable 5;CursorBench 的最高 effort 档位则以约 0.5% 的差距落后。

我觉得问题也因此变得更有意思:既然纸面能力已逼近、甚至局部反超,为什么 Fable 5 仍是 Anthropic 产品矩阵里更高一层的旗舰?答案也许不在一个更长的排行榜,而在于两把完全不同的尺子。

模型分层,从来不止一张智商排行榜

第一把尺子是任务效率:完成度、速度和 token 成本。给定一个代码库或办公流程,谁能以更少调用、更短时间、更高成功率把事情做完,Opus 5 的主战场就在这里。其官方 API 定价为输入 5 美元/百万 token、输出 25 美元/百万 token;Fable 5 官方定价则为输入 10 美元/百万 token、输出 50 美元/百万 token,恰好是前者的两倍。

第二把尺子,我更愿意叫“自主边界”:模型能在什么权限下连续运行多久,在网络安全、生物研究等双重用途任务中,能力会暴露到什么程度。

Reuters 采访中,Anthropic 产品负责人 Dianne Penn 的区分很直接:Opus 5 看重性价比,Fable 5 留给“数天级、非常自主”的项目。

换句话说,通用模型排行榜主要量的是第一把尺子;而第二把尺子——权限、时长、风险暴露面和治理成本,才越来越决定旗舰档位。Fable 5 对应的并不只是更长的任务链,并且是更严的安全与访问安排。

需要说明的是,这是 Anthropic 官方给出的产品分层逻辑。一方面,长程自主任务确实对应更高的安全治理与权限管控成本;另一方面,在跑分差距很小的前提下,用“自主边界”划分档位,也客观上支撑了 Fable 5 的溢价空间。我们不必将其简单归为营销,但也不应完全顺着厂商的框架理解模型的高低之分。

从会回答到会收尾,差的是闭环能力

如果说第一把尺子衡量的是任务效率,那么 Opus 5 的效率优势不是单步推理更聪明,而是更强的任务闭环能力。Anthropic 给出的三个案例,恰好把这种能力拆成三个层级。

面对无法直接解析的机械零件图,它没有凭空估算尺寸,而是自行编写计算机视觉管线,从原始像素中提取几何信息、生成 FreeCAD 模型——没有现成工具,就自己造出工具。

面对开源包管理器的真实 bug,它没有停在修复表面报错,而是追溯到社区补丁遗漏的边界条件——不是“暂时能用”,而是根治根因。

面对无实时数据源的交易所行情接口,它不局限于写完代码就交付,而是主动搭建测试 harness(测试框架)校验解析逻辑——没有验证条件,就创造验证条件。

只负责生成答案的模型更像工具:给出答案,任务似乎就结束了;具备自检和验证能力的模型则开始接近协作者:给出答案只是起点,还要继续确认答案能否经得起检验。这正是“会回答”与“会收尾”的区别。

当然,这些都是 Anthropic 自选的典型场景,展示的是能力上限,并不代表所有真实任务都能达到同等完成度,其普适效果仍需企业在自身业务中验证。

安全护栏,正在变成可调节的刻度尺

应该说,安全部分反而更能说明产品分层不是简单的强或弱。按 Anthropic 基于 OSS-Fuzz 基准开展的内部评测,Opus 5 在漏洞发现上已经接近同系列安全向旗舰 Mythos 5;但在把漏洞发展为可利用攻击手段上,明显落后。

“发现能力接近、利用能力却不接近”,这意味着 Anthropic 尝试把能力区分细化到任务环节:允许源码漏洞发现等防御性用途,却限制二进制漏洞扫描、渗透测试和漏洞利用(exploit)开发。它不是把网络安全整个切掉,而是在决定模型能走到链条的哪一步。

护栏也不再是单纯的拒答开关。Anthropic 预计,Opus 5 的网络安全分类器介入频率比 Fable 5 低约 85%;被拦截的请求可自动降级到 Opus 4.8,而不是直接结束对话。企业买的不是“有没有护栏”,而是护栏调到多紧、被拦下后怎么交接。

这里仍要保留一个关键问号:安全能力的核心价值在于对抗场景,而非静态基准测试。上述数据均来自厂商内部评测,其护栏在真实渗透与绕过尝试中的实际表现,仍有待外部安全社区的检验。

可靠的结果,从来都不是免费的

在肯定这些进步的同时,我觉得仍有必要保留一点审慎。模型会自检,不等于验证成本消失。它只是把部分人工复核,换成模型多跑几轮、多调用几次工具、多消耗 token 和时延。

模型多跑几轮、多调用几次工具所增加的 token 和时延成本,相对容易计量;更难量化的是,人类的审核工作会从逐行复审答案本身,转向复审答案的产生过程,这对证据链、日志和审计机制提出了更高要求。

更值得警惕的是,模型说“我已经验证过了”以后,人如何确认它真的验证过?如果团队因此降低警惕、减少必要复核,就会出现自动化依赖或过度信任:模型的自证行为反而可能让人的判断力打折。高价值流程中,人类的审计责任并没有消失,只是转向检查证据链、工具日志、权限边界和异常交接。

所以企业评估 Opus 5 或同类模型时,与其先问“哪个跑分最高”,不如拿团队原本需要人工复核两小时的真实任务做小测试:记录模型用了多少 token、重试几次、留下哪些验证证据,以及最终是否仍要人工介入。这些数据比排行榜更接近采购决策。

Loop Engineering (参见本号文章:Claude Code 真正的革命是循环工程)的核心逻辑,是用多轮自检迭代提高任务成功率。其根本原因是:在模型还不够可靠的前提下,怎样通过工程机制让它开始承担真实任务。

Opus 5 把问题推进了一步:当自检、降级和护栏都被写进产品本身,企业购买的不是更高的 benchmark 分数,而是一条可配置的“能力—成本—风险”曲线,以及出了问题后的降级与交接机制。

如果你的团队准备把智能体放进真实业务流程,你会先问它能答出什么,还是先问它如何证明自己把事收尾了?

参考资料

Anthropic,《Introducing Claude Opus 5》,2026 年 7 月 24 日。

Anthropic / Claude Platform Docs,《Introducing Claude Fable 5 and Claude Mythos 5》。

Reuters,《Anthropic rolls out Opus 5 AI model in efficiency upgrade》,2026 年 7 月 24 日。

The New Stack,《Anthropic's Opus 5 is almost Fable 5》。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-25,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 模型分层,从来不止一张智商排行榜
  • 从会回答到会收尾,差的是闭环能力
  • 安全护栏,正在变成可调节的刻度尺
  • 可靠的结果,从来都不是免费的
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档