首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >别把 Agent Harness 和评测 Harness 混成一个东西

别把 Agent Harness 和评测 Harness 混成一个东西

原创
作者头像
用户9746675
发布于 2026-10-10 11:04:58
发布于 2026-10-10 11:04:58
170
举报

做 Agent 的人很容易把两件事焊在一起:一边是让模型能跑起来的 Agent Harness,一边是决定能不能上线的评测 Harness。混在一起的后果很具体——你用自己的脚手架跑自己的任务,再给自己打高分,最后只验证了「这套系统喜欢自己」。

更清楚的分法是:Agent Harness 负责执行;评测 Harness 负责包围执行,并用门禁说话。

一、两套东西各自管什么

Agent Harness 管循环、工具、权限、状态、压缩、恢复。它回答:任务怎么往前走。

评测 Harness 管版本化任务、隔离环境、重复 Trial、可观测证据、评估器和发布门禁。它回答:这套「模型 + Agent Harness」整体值不值得放进生产。

如果你的评测脚本直接复用生产循环,又没有独立的任务集与环境重置,那么评测结果更像演示录像,不像回归。

二、评测至少要分开算的几类指标

只报一个成功率不够。更有用的拆法是:

  • 任务结果:做成了没有、该拒答时有没有拒
  • 策略合规:有没有越权读、越权写、越权外传
  • 证据质量:结论有没有可核对的引用或副作用证明
  • 恢复能力:超时、重启、重复投递后能不能接上
  • 成本与延迟:调用次数、token、重试、P95

把这些揉成一个分数,缺点会被平均值藏起来。线上最痛的往往不是平均成功率,而是偶发越权和偶发空转。

三、为什么要做回放和故障注入

确定性评估器适合事实与不变量;LLM 裁判只适合范围明确的主观维度。更关键的是,评测环境默认不要给生产权限。

回放解决「同样输入再次发生时行为是否漂移」。故障注入解决「坏天气会不会翻车」:超时、畸形工具结果、重复投递、过期数据、提示词注入、进程重启。

没有故障注入的评测,等于只在晴天测刹车。

四、发布门禁该长什么样

能力探索集和回归集要分开。前者找边界,后者保护已经依赖的行为。每次 Trial 前重置权威环境状态,结束后直接验证最终状态,而不是只听模型说「完成了」。

门禁建议至少挡住三类回归:

  1. 成功率明显掉,或拒答正确率掉
  2. 未授权读写上升
  3. 单位成功成本或恢复失败率越线

过不了门禁就不要发版,哪怕 demo 看起来更聪明。

五、落地时的最小闭环

  1. 先固定 10 到 20 个真实任务,做成版本化回归集
  2. 每个任务至少两轮 Trial,记录轨迹与成本,不记录隐藏思维链冒充证据
  3. 加三类故障:工具超时、重复副作用、进程重启
  4. 用确定性检查验收最终状态,再用人工抽检争议样本

这样评测 Harness 才是在保护业务,而不是给 Agent Harness 做广告。

结语

Agent Harness 让系统能跑;评测 Harness 让你知道该不该继续跑。前者追求交付,后者追求证伪。把两者分开,团队才不会在「自己测自己」里越跑越自信。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、两套东西各自管什么
  • 二、评测至少要分开算的几类指标
  • 三、为什么要做回放和故障注入
  • 四、发布门禁该长什么样
  • 五、落地时的最小闭环
  • 结语
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档