操作场景
在线测试用于在控制台中实时调试和验证智能搜索效果。页面采用三栏布局:配置区、编排区、测试区,您可以在配置区管理提示词模板,在编排区调整大模型与检索参数,在测试区即时验证问答效果。在线测试是效果调优的核心工作台,建议在文档导入完成后优先使用。
进入在线测试
1. 登录 腾讯云 ES 控制台,在左侧导航栏选择 智能搜索开发 > 应用开发。
2. 在应用列表中,单击目标应用的名称,进入应用详情页。
3. 在应用详情页,选择 在线测试 标签页,进入在线测试工作台。
页面说明

在线测试页面分为左中右三栏:
区域 | 说明 |
配置区(左栏) | 管理提示词(Prompt),支持 AI 生成和手动填入两种模式。提示词用于规范大模型的回答行为 |
编排区(中栏) | 配置大模型、文档库、检索方式和各项检索参数 |
测试区(右栏) | 输入问题并实时查看大模型的回答结果,支持多轮对话、查看查询分析以及召回结果 |
页面顶部操作栏包含:
操作 | 说明 |
创建配置 | 新建一组完整的配置(提示词 + 编排参数),可保存多个配置方便对比 |
配置展示 | 控制页面左栏(配置区)的显示/隐藏 |
对比配置项 | 支持选择两组不同配置进行 A/B 对比测试 |
配置区
配置区用于编辑提示词(Prompt),规范大模型基于检索结果回答问题时的行为准则。
提示词编辑
提示词支持两种模式:
模式 | 说明 |
AI 生成 | 由系统基于文档库内容自动生成提示词模板,可在此基础上进行修改 |
填入模板 | 填入预置的模板后,手动编写完整的提示词内容 |
提示词内容限制 4000 字符。
提示词编写建议
一个完整的提示词通常包含以下部分:
系统设定:定义大模型的角色和行为边界(如"你是专业的智能信息检索助手")
响应规则:规范回答的准确性、结构、简洁性和核实要求
输出格式:约束输出的格式和质量标准
编排区
编排区用于配置大模型和检索相关参数,决定检索和回答的核心行为。
大模型
参数 | 说明 |
大模型 | 选择用于生成回答的大语言模型 |
记忆轮次 | 多轮对话中保留的历史对话轮次数量,影响上下文连贯性,此记忆仅用于在线测试,发布后需自行开发 |
联网搜索 | 开启后大模型将结合互联网搜索结果回答问题,适合需要实时信息的场景 |
文档库
参数 | 说明 |
文档库 | 选择参与检索的文档库,支持同时关联多个文档库。单击 + 添加 可追加文档库 |
检索方式
参数 | 说明 |
检索方式 | 选择检索算法,如"混合检索-文本向量并行",同时利用文本匹配和向量语义匹配能力 |
权重设置 | 调节文本检索与向量检索的权重比例(如文本 0.5 / 向量 0.5),拖动滑块调整 |
召回数量(TopK) | 每次查询最终返回的结果数量 |
num_candidates | 召回阶段从索引中获取的候选文档数量,通常大于 TopK,值越大召回越全但耗时越长 |
similarity | 相似度阈值,仅返回相似度高于此值的结果,设为 0.00 表示不过滤 |
重排序
参数 | 说明 |
重排序 | 开启后将对初步召回的结果进行二次排序,提升最终结果的相关性排序质量 |
大模型精排
参数 | 说明 |
大模型精排 | 开启后由大模型对召回结果进行精细化排序和筛选,进一步优化最终呈现给用户的结果质量 得分说明 4 (核心答案): 分片直接、完整地回答了用户问题。 3 (核心论据/方法): 分片提供了构建答案所需的核心方法、关键论据或关键范例。 2 (背景知识): 分片提供了有用的背景信息或相关上下文,能丰富答案但非核心。 1 (提及但无价值): 分片提及了问题关键词,但信息空洞或与问题无关,没有引用价值。 0 (完全无关): 分片内容与用户问题的领域完全不相关。 |
测试区
测试区用于即时验证当前配置的实际效果。
执行测试
1. 在测试区底部的输入框中输入问题(支持 Shift+回车换行,回车发送)。
2. 系统将基于当前编排区的配置执行检索和生成,实时返回大模型的回答。
3. 回答内容包含大模型的推理过程和最终答案,可观察模型如何利用检索到的文档内容作答。
操作说明
操作 | 说明 |
清空对话 | 清除当前测试区的所有对话历史,重新开始测试 |
多轮对话 | 支持连续提问,大模型会结合历史对话上下文(受"记忆轮次"参数控制)进行回答 |
新一轮对话 | 当修改了提示词及相关参数,将自动发起新一轮对话 |
注意事项
在线测试调用的原子模型服务会产生费用,每次检索和生成均消耗 Token,计费方式参见 智能搜索开发服务定价。
调整参数后无需保存即可直接测试,但若需在发布时使用该参数组合,请通过 创建配置 保存为命名配置。
在线测试适用于单条或少量查询的效果验证。如需系统性评估检索质量,建议使用 效果评测。
联网搜索和大模型精排功能会增加响应耗时和 Token 消耗,建议按需开启。
后续操作
在线测试中确认检索和生成效果后,您可以:
效果评估:基于评测数据集对检索效果进行量化评估。详情请参见 效果评估。
发布服务:将调试完成的应用发布为独享服务。详情请参见 发布管理。
服务监控:发布后通过服务监控观察线上运行状态。详情请参见 服务监控。