操作场景
效果评测用于对检索与生成的效果进行系统性的量化分析。与在线测试的单条验证不同,效果评测通过评测数据集批量执行查询,输出召回率、精确率等客观指标,帮助您全面衡量搜索、生成质量,为效果调优提供数据依据。
建议在在线测试确认基本检索效果后,使用效果评测进行更深入的量化分析。
创建评测数据集
评测数据集是效果评测的基础,定义了查什么和期望查到什么。
1. 在应用详情页,选择 效果评测 > 评测数据集 标签页,单击创建评测集。

配置以下参数:
参数 | 说明 |
评测集名称 | 自定义评测数据集的名称,便于区分不同评测任务 |
创建方式 | 文档自动生成:基于所选文档,由大模型自动生成评测集。系统会按文档内容自动构建测试问答对,无需手动编写。每个文档预期生成约 5 个测试问答。 本地导入:基于模板上传评测集,适用于已有离线评测数据的场景。 |
评测集消耗 | 基于经验评测,跟文档数据和大小有关,具体请依据实际账单为准。 |
2. 单击确定,开始评测集创建。
执行效果评测
1. 在效果评测页面,选择 评测任务 标签页,单击 创建评测任务。

2. 选择已创建的评测数据集,并确认评测配置。

参数 | 说明 |
基本信息 | 配置本次评测包含的任务项,每个任务对应一个待评测的检索配置。 |
裁判模型 | 裁判模型用于自动评判检索结果与期望答案的匹配程度,建议选择效果稳定的大模型。该参数会直接影响评测打分的准确性。 |
评测集 | 数据来源,支持三种方式 文档自动生成:基于上传的文档,由大模型自动生成评测集。 上传评测集:基于模板上传评测集。 选择已有数据集:选择已创建的评测集及其版本。 |
任务消耗预估 | 任务消耗预估(按 token 计费),确认无误后单击开始评测。 |
3. 单击 开始评测,系统将按照评测集中的查询词逐一执行检索,并自动计算评测指标。评测耗时取决于数据集的规模,您可以在任务列表中查看评测进度。

查看评测结果
评测完成后,单击任务名称进入评测详情页。

检索质量得分包含三个指标:
精确度(Precision):检索返回的结果中相关文档所占的比例。衡量系统的查准能力,精确度越高,用户看到的噪声结果越少。
召回率(Recall):所有相关文档中被检索命中的比例。衡量系统的查全能力,召回率越高,遗漏的相关内容越少。
实体召回率(Entity Recall):针对命名实体(如人名、地名、产品型号、专有术语等)的召回率。衡量系统对关键实体信息的覆盖能力,在知识密集型问答场景中尤为关键。
生成质量得分包含四个指标:
准确度(Accuracy):生成回答的事实正确性,即回答内容是否与客观事实一致。准确度直接决定用户对系统可信程度的判断。
忠实度(Faithfulness):生成回答对所召回文档内容的忠实程度,即回答是否严格基于检索到的材料,是否存在无依据的编造(幻觉)。忠实度越高,说明回答越可溯源。
相关性(Relevance):生成回答与用户问题的语义匹配程度,即回答是否紧扣问题主旨,有无偏题或冗余展开。
噪声敏感度(Noise Sensitivity):生成回答对召回内容中无关信息的抗干扰能力。噪声敏感度越低,说明模型越能忽略检索结果中的不相关内容,仅提取有效信息作答。
您可以根据各项指标的表现,判断评测是否达到预期:
优:检索与生成质量都达到高标准
良:基本可用,少量细节需优化
一般:存在明显问题,建议调优
较差:建议重新审视文档内容或检索配置
注意事项
评测数据集的构建直接影响评测结果的参考价值。建议覆盖常见的用户搜索场景,并为每条查询标注准确的期望文档。
效果评测过程中调用的原子模型服务会产生费用,计费方式参见 计费说明。
评测结果仅供参考,实际线上搜索效果可能因真实用户的查询习惯不同而有所差异。
后续操作
发布服务:将调试完成的应用发布为独享服务。详情请参见 发布管理。
服务监控:发布后通过服务监控观察线上运行状态。详情请参见 服务监控。