帮你快速理解、总结文档立即下载

效果评测

最近更新时间:2026-08-10 15:47:01
我的收藏

操作场景

效果评测用于对检索与生成的效果进行系统性的量化分析。与在线测试的单条验证不同,效果评测通过评测数据集批量执行查询,输出召回率、精确率等客观指标,帮助您全面衡量搜索、生成质量,为效果调优提供数据依据。
建议在在线测试确认基本检索效果后,使用效果评测进行更深入的量化分析。

创建评测数据集

评测数据集是效果评测的基础,定义了查什么和期望查到什么。
1. 在应用详情页,选择 效果评测 > 评测数据集 标签页,单击创建评测集

配置以下参数:
参数
说明
评测集名称
自定义评测数据集的名称,便于区分不同评测任务
创建方式
文档自动生成:基于所选文档,由大模型自动生成评测集。系统会按文档内容自动构建测试问答对,无需手动编写。每个文档预期生成约 5 个测试问答。
本地导入:基于模板上传评测集,适用于已有离线评测数据的场景。
评测集消耗
基于经验评测,跟文档数据和大小有关,具体请依据实际账单为准。
2. 单击确定,开始评测集创建。

执行效果评测

1. 在效果评测页面,选择 评测任务 标签页,单击 创建评测任务
创建评测任务
创建评测任务

2. 选择已创建的评测数据集,并确认评测配置。
配置评测任务
配置评测任务

参数
说明
基本信息
配置本次评测包含的任务项,每个任务对应一个待评测的检索配置。
裁判模型
裁判模型用于自动评判检索结果与期望答案的匹配程度,建议选择效果稳定的大模型。该参数会直接影响评测打分的准确性。
评测集
数据来源,支持三种方式
文档自动生成:基于上传的文档,由大模型自动生成评测集。
上传评测集:基于模板上传评测集。
选择已有数据集:选择已创建的评测集及其版本。
任务消耗预估
任务消耗预估(按 token 计费),确认无误后单击开始评测。
3. 单击 开始评测,系统将按照评测集中的查询词逐一执行检索,并自动计算评测指标。评测耗时取决于数据集的规模,您可以在任务列表中查看评测进度。


查看评测结果

评测完成后,单击任务名称进入评测详情页。
评估报告详情
评估报告详情

检索质量得分包含三个指标:
精确度(Precision):检索返回的结果中相关文档所占的比例。衡量系统的查准能力,精确度越高,用户看到的噪声结果越少。
召回率(Recall):所有相关文档中被检索命中的比例。衡量系统的查全能力,召回率越高,遗漏的相关内容越少。
实体召回率(Entity Recall):针对命名实体(如人名、地名、产品型号、专有术语等)的召回率。衡量系统对关键实体信息的覆盖能力,在知识密集型问答场景中尤为关键。
生成质量得分包含四个指标:
准确度(Accuracy):生成回答的事实正确性,即回答内容是否与客观事实一致。准确度直接决定用户对系统可信程度的判断。
忠实度(Faithfulness):生成回答对所召回文档内容的忠实程度,即回答是否严格基于检索到的材料,是否存在无依据的编造(幻觉)。忠实度越高,说明回答越可溯源。
相关性(Relevance):生成回答与用户问题的语义匹配程度,即回答是否紧扣问题主旨,有无偏题或冗余展开。
噪声敏感度(Noise Sensitivity):生成回答对召回内容中无关信息的抗干扰能力。噪声敏感度越低,说明模型越能忽略检索结果中的不相关内容,仅提取有效信息作答。
您可以根据各项指标的表现,判断评测是否达到预期:
:检索与生成质量都达到高标准
:基本可用,少量细节需优化
一般:存在明显问题,建议调优
较差:建议重新审视文档内容或检索配置

注意事项

评测数据集的构建直接影响评测结果的参考价值。建议覆盖常见的用户搜索场景,并为每条查询标注准确的期望文档。
效果评测过程中调用的原子模型服务会产生费用,计费方式参见 计费说明
评测结果仅供参考,实际线上搜索效果可能因真实用户的查询习惯不同而有所差异。

后续操作

发布服务:将调试完成的应用发布为独享服务。详情请参见 发布管理
服务监控:发布后通过服务监控观察线上运行状态。详情请参见 服务监控