一句话结论:没有单项全胜的模型。读文献与综述用 GLM-5.2,复现与数据处理用 DeepSeek-V4-Pro,长文推理与成稿用 Kimi-K3, 而关键事实、数据与引文必须人工核验——这是本次评估中唯一没有替代方案的环节。
科研任务 | Kimi-K3x1.62 | GLM-5.2x0.79 | DeepSeek-V4-Prox0.16 | DeepSeek-V4-Flashx0.06 | Hy3 混元限时免费 | MiniMax-M3x0.25 |
|---|---|---|---|---|---|---|
长文阅读与综述 | 强 | 强 | 中 | 弱 | 中 | 弱 |
论文复现与代码 | 强 | 强 | 强 | 中 | 中 | 中 |
数据分析与统计 | 强 | 中 | 强 | 中 | 中 | 弱 |
学术写作与润色 | 强 | 中 | 中 | 弱 | 中 | 弱 |
事实准确性 | 中 | 强 | 弱 | 中 | 中 | 中 |
图表与扫描件 | 强 | 中 | 中 | 中 | 弱 | 强 |
这是本次评估中唯一没有替代方案的环节,而几个模型的差距在这里最刺眼:


方法说明:本卡为公开资料的归纳整理,不代表任何厂商官方结论。 科研场景中,模型的角色是加速理解与执行,不是结论来源;文献引用、实验数据、统计显著性判断均需回到原始文献与原始数据核对。
数据来源:Artificial Analysis 智力指数、Vellum 与 BenchLM 榜单、Epoch AI 基准分析、DeepInfra 开放权重横评、腾讯云与厂商公开技术资料,以及 WorkBuddy 官方模型选择文档。快照时间 2026 年 7–9 月。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。