帮你快速理解、总结文档立即下载

在线测试

最近更新时间:2026-08-10 15:47:01
我的收藏

操作场景

在线测试用于在控制台中实时调试和验证智能搜索效果。页面采用三栏布局:配置区编排区测试区,您可以在配置区管理提示词模板,在编排区调整大模型与检索参数,在测试区即时验证问答效果。在线测试是效果调优的核心工作台,建议在文档导入完成后优先使用。

进入在线测试

1. 登录 腾讯云 ES 控制台,在左侧导航栏选择 智能搜索开发 > 应用开发
2. 在应用列表中,单击目标应用的名称,进入应用详情页。
3. 在应用详情页,选择 在线测试 标签页,进入在线测试工作台。

页面说明

在线测试
在线测试

在线测试页面分为左中右三栏:
区域
说明
配置区(左栏)
管理提示词(Prompt),支持 AI 生成和手动填入两种模式。提示词用于规范大模型的回答行为
编排区(中栏)
配置大模型、文档库、检索方式和各项检索参数
测试区(右栏)
输入问题并实时查看大模型的回答结果,支持多轮对话、查看查询分析以及召回结果
页面顶部操作栏包含:
操作
说明
创建配置
新建一组完整的配置(提示词 + 编排参数),可保存多个配置方便对比
配置展示
控制页面左栏(配置区)的显示/隐藏
对比配置项
支持选择两组不同配置进行 A/B 对比测试

配置区

配置区用于编辑提示词(Prompt),规范大模型基于检索结果回答问题时的行为准则。

提示词编辑

提示词支持两种模式:
模式
说明
AI 生成
由系统基于文档库内容自动生成提示词模板,可在此基础上进行修改
填入模板
填入预置的模板后,手动编写完整的提示词内容
提示词内容限制 4000 字符

提示词编写建议

一个完整的提示词通常包含以下部分:
系统设定:定义大模型的角色和行为边界(如"你是专业的智能信息检索助手")
响应规则:规范回答的准确性、结构、简洁性和核实要求
输出格式:约束输出的格式和质量标准

编排区

编排区用于配置大模型和检索相关参数,决定检索和回答的核心行为。

大模型

参数
说明
大模型
选择用于生成回答的大语言模型
记忆轮次
多轮对话中保留的历史对话轮次数量,影响上下文连贯性,此记忆仅用于在线测试,发布后需自行开发
联网搜索
开启后大模型将结合互联网搜索结果回答问题,适合需要实时信息的场景

文档库

参数
说明
文档库
选择参与检索的文档库,支持同时关联多个文档库。单击 + 添加 可追加文档库

检索方式

参数
说明
检索方式
选择检索算法,如"混合检索-文本向量并行",同时利用文本匹配和向量语义匹配能力
权重设置
调节文本检索与向量检索的权重比例(如文本 0.5 / 向量 0.5),拖动滑块调整
召回数量(TopK)
每次查询最终返回的结果数量
num_candidates
召回阶段从索引中获取的候选文档数量,通常大于 TopK,值越大召回越全但耗时越长
similarity
相似度阈值,仅返回相似度高于此值的结果,设为 0.00 表示不过滤

重排序

参数
说明
重排序
开启后将对初步召回的结果进行二次排序,提升最终结果的相关性排序质量

大模型精排

参数
说明
大模型精排
开启后由大模型对召回结果进行精细化排序和筛选,进一步优化最终呈现给用户的结果质量
得分说明
4 (核心答案): 分片直接、完整地回答了用户问题。
3 (核心论据/方法): 分片提供了构建答案所需的核心方法、关键论据或关键范例。
2 (背景知识): 分片提供了有用的背景信息或相关上下文,能丰富答案但非核心。
1 (提及但无价值): 分片提及了问题关键词,但信息空洞或与问题无关,没有引用价值。
0 (完全无关): 分片内容与用户问题的领域完全不相关。

测试区

测试区用于即时验证当前配置的实际效果。

执行测试

1. 在测试区底部的输入框中输入问题(支持 Shift+回车换行,回车发送)。
2. 系统将基于当前编排区的配置执行检索和生成,实时返回大模型的回答。
3. 回答内容包含大模型的推理过程和最终答案,可观察模型如何利用检索到的文档内容作答。

操作说明

操作
说明
清空对话
清除当前测试区的所有对话历史,重新开始测试
多轮对话
支持连续提问,大模型会结合历史对话上下文(受"记忆轮次"参数控制)进行回答
新一轮对话
当修改了提示词及相关参数,将自动发起新一轮对话

注意事项

在线测试调用的原子模型服务会产生费用,每次检索和生成均消耗 Token,计费方式参见 智能搜索开发服务定价
调整参数后无需保存即可直接测试,但若需在发布时使用该参数组合,请通过 创建配置 保存为命名配置。
在线测试适用于单条或少量查询的效果验证。如需系统性评估检索质量,建议使用 效果评测
联网搜索和大模型精排功能会增加响应耗时和 Token 消耗,建议按需开启。

后续操作

在线测试中确认检索和生成效果后,您可以:
效果评估:基于评测数据集对检索效果进行量化评估。详情请参见 效果评估
发布服务:将调试完成的应用发布为独享服务。详情请参见 发布管理
服务监控:发布后通过服务监控观察线上运行状态。详情请参见 服务监控