首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Claude Opus 4.7发布:更严谨的长任务处理与自我验证能力

Claude Opus 4.7发布:更严谨的长任务处理与自我验证能力

作者头像
用户11563501
发布2026-06-23 13:19:12
发布2026-06-23 13:19:12
2110
举报
Claude Opus 4.7封面图
Claude Opus 4.7封面图

Anthropic 刚刚发布迄今为止最强大的Opus模型4.7版本。相比前代4.6版本,它在处理长任务时更加严谨,能更精确地遵循指令,并在反馈前验证自己的输出。这意味着用户可以更放心地将复杂工作交给它处理,减少监督需求。

核心能力提升

长任务严谨性:Opus 4.7对复杂、长时间运行的任务保持严谨和一致性。早期测试者反馈,它能处理那些以前需要密切监督的最困难编码工作。模型会在计划阶段捕获自己的逻辑错误,并加快执行速度。

视觉能力突破:支持更高分辨率图像,长边最高2576像素(约375万像素),是之前Claude模型的3倍多。这为计算机使用代理读取密集截图、从复杂图表中提取数据等应用打开了新可能。

指令遵循精度:Opus 4.7严格遵循指令细节,这意味着为早期模型编写的提示词可能需要重新调整。在实际使用中,它会对技术讨论推回,帮助用户做出更好的决策。

记忆能力提升:Opus 4.7更好地使用文件系统基于的记忆,能在长时间、多会话工作中记住重要备忘录,并在转向新任务时减少前期上下文需求。

企业级应用表现

根据28家企业的测试反馈,Opus 4.7在多个领域表现突出:

  • Hex:低努力级别的Opus 4.7大致相当于中等努力级别的Opus 4.6
  • Cursor:在CursorBench上达到70%通过率,相比Opus 4.6的58%有显著提升
  • CodeRabbit:代码审查召回率提升超过10%,能发现最复杂PR中最难检测的bug
  • XBOW:视觉识别准确率从54.5%跃升至98.5%,解锁了之前无法使用的应用场景

新增功能

xhigh努力级别:在high和max之间新增额外高努力级别,为困难问题提供更精细的推理-延迟权衡控制。

/ultrareview命令:专门代码审查会话,标记审阅者会注意的问题。Pro和Max用户可获得3次免费试用。

自动模式扩展:为Max用户扩展自动模式,减少长任务中断。

安全特性

作为Project Glasswing计划的一部分,Opus 4.7的网络安全能力被有意限制,并配备了自动检测和阻止高风险网络安全请求的防护措施。安全专业人员可通过新的[网络安全验证计划](https://claude.com/form/cyber-use-case)申请合法使用。

安全性能对比
安全性能对比

技术迁移注意事项

分词器更新:Opus 4.7使用更新的分词器,相同输入可能映射到更多token(约1.0-1.35倍,取决于内容类型)。测试数据显示,Claude Opus 4.7在处理相同内容时使用了5657个token,比4.6版本的4262个token高出33%。与Gemini Pro的2742个token相比,更是多出106%。从这个角度看,4.7相较于4.6更贵。

思考深度增加:在更高努力级别(特别是代理设置的后期回合)思考更多,提高可靠性但产生更多输出token。

token效率对比
token效率对比

实际应用案例

Rust语音引擎:Opus 4.7自主构建了完整的Rust文本转语音引擎——包括神经网络模型、SIMD内核和浏览器演示,然后通过语音识别器验证输出与Python参考匹配。

企业文档分析:在Databricks的OfficeQA Pro评估中,使用源信息时的错误比Opus 4.6减少21%。

终端操作:通过Terminal Bench任务,包括Opus 4.6无法解决的并发bug。

定价和可用性

Opus 4.7现已通过Claude官网(http://claude.ai)、Claude平台和所有主要云平台提供。定价与Opus 4.6相同:输入token每百万5美元,输出token每百万25美元。

开发者可通过Claude API使用claude-opus-4-7模型。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-04-17,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 核心能力提升
  • 新增功能
  • 安全特性
  • 技术迁移注意事项
  • 实际应用案例
  • 定价和可用性
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档