首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Harness 买到的往往不是分数:同一模型下,成本差从哪来

Harness 买到的往往不是分数:同一模型下,成本差从哪来

原创
作者头像
用户9746675
发布于 2026-10-10 11:03:38
发布于 2026-10-10 11:03:38
90
举报

10 月初有一篇 arXiv 论文标题很刺眼:What Does a Harness Buy? Tokens, Mostly。意思是:你换一套 Harness,买到的常常不是更高的通过率,而是一张不一样的 token 账单。

这对选型很重要。过去大家比 Harness,爱看榜单分数涨了几分;论文把「换 Harness」「换模型」「同配置重跑」放在同一把尺子上,结论更冷静:换 Harness 带来的结果翻转,经常接近重跑噪声;真正拉开任务成败的,仍是模型。但同模型同任务下,不同 Harness 的成本可以差到数倍。

一、先把「分数差」和「噪声」分开

小样本评测最容易骗人。几十个任务、只跑一轮,2 到 3 个百分点的优势,往往落在重跑波动里。

更稳的做法是:固定模型、工具、环境和价格;同一配置至少再跑一遍当对照;报告中位数和区间,而不是只报一次最高分。厂商宣传的小幅增益,先问一句:重跑同配置,波动有多大?

如果答不上来,这份对比更像营销材料,还不是工程结论。

二、成本差主要来自三件事

第一,每步重发的固定前置,也就是 preamble:系统提示加工具 schema。有的 Harness 每一步都塞进上万 token 的说明,有的只有几百。步数一多,这部分会把账单撑开。

第二,步数本身。同样任务,有的循环爱试探,有的更克制。步数少不等于更好,但步数失控一定更贵。

第三,缓存命中。同样总输入,缓存价差可以让账单排序完全改写。只看总 token、不看缓存比例,会把「会复用上下文」和「每次重传全文」混为一谈。

所以选型时,除了成功率,至少要盯:单次成功成本、平均步数、preamble 体积、缓存命中率。

三、Harness 到底该买什么

如果论文说换 Harness 对通过率像噪声,是不是 Harness 就不重要了?不是。

Harness 买到的,更多是约束与运营能力:超时熔断、权限闸门、会话恢复、独立验收、可观测轨迹。这些不一定立刻抬高 benchmark 分数,但决定你敢不敢让它在真实业务里过夜。

换句话说:模型决定上限,Harness 决定账单形状和失败是否可控。分数接近时,选更省、更可恢复、更可审计的那一套,通常比追榜更理性。

也别走到另一个极端:为了省 token 把验收和权限砍掉。那样省下的是 API 费,亏掉的是事故费。

四、一套可落地的对比方法

拿公司最常做的 10 到 20 个真实任务,固定同一个模型:

  1. 每个任务至少跑两轮,记录成功与否、步数、耗时、输入输出 token、缓存命中、重试次数
  2. 用单位成功成本排序,而不是只看通过率
  3. 把失败样本按超时、工具错、上下文丢失、自我欺骗分类
  4. 最后再看权限、恢复、Dry-run 这些生产能力是否够用

没有第 4 步,最便宜的 Harness 也可能最贵:因为它把事故成本藏到了线上。

结语

Harness 不是分数魔术箱。同一模型下,它更常改变的是你怎么花 token、怎么止损、怎么接上中断。把评测从「谁多两分」改成「谁在可控成本里稳定交付」,选型才会从热闹回到工程。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、先把「分数差」和「噪声」分开
  • 二、成本差主要来自三件事
  • 三、Harness 到底该买什么
  • 四、一套可落地的对比方法
  • 结语
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档