这次我用 Qwen3.8-Flash-Next 的 NVFP4 版本做了本地智能体编程基准测试,也顺手和 27B 模型以及其他几个模型比了比那个分数偏低的,是 HuggingFace 上一个随机发布的未审查版本之后我还打算测测别的版本
结论挺有意思:在全部我测过的本地模型里,它的分数几乎是最高的,而且效率特别突出——每拿一分需要的请求数和生成 token 数都是最少的,并且是在中等推理强度下做到的这个基准里,极高推理强度(xhigh)依然没啥用不仅如此,它跑得还特别快
关键是,这还只是个训练没充分的模型,表现就已经这么能打了