刚刚,DeepSeek-V4-Flash正式版API上线!DeepSeek-V4-Pro还没来,官方说将会在8月初上线!
这次Flash版本能力属于超级加强,在官方给出的评分中可以看到,部分能力(高难度编码和自动化任务)得到了翻倍加强!
最有冲击力的一组数据:DeepSWE 跑分从 7.3 涨到 54.4,7 倍多。上一代在这项上几乎是"不会写代码"的水平,这一代直接能干专业工程师的活。
Cybergym 从 38.7 涨到 76.7。这个是网络安全攻防模拟,要求 AI 找出漏洞、复现攻击路径。上一代是"业余选手",这一代直接拉到"接近专业人员"水平。
AutomationBench 和 DSBench-Hard 都直接翻倍还多。这俩一个是自动化任务,一个是高难度编码专项,都是实打实考验 AI 能不能"自己动手把活干完"的项目。
Opus-4.8 是 Anthropic 的当家旗舰,模型体量、训练成本都远高于 Flash 这种"轻量版"。
在 Terminal Bench、AutomationBench、DSBench-FullStack、Agents' Last Exam 这种"日常 Agent 任务"上,V4-Flash 跟 Opus-4.8 已经咬得非常死,差距在 5% 以内。Agents' Last Exam 直接 25.2 vs 25.7,几乎打平。
在 NL2Repo、DSBench-Hard 这种"超长链路、超复杂代码"上,Opus-4.8 还是有明显优势。这俩考验的是 AI 能不能扛住一个真实大型项目从头搭到尾,Opus 的底子更厚。
话不多说了,我要去在真实业务上试试它的水平了~欢迎大家关注我,后续更新实际体验~