服务监控用于实时查看智能搜索应用中各服务的运行状态和性能指标,帮助您及时发现异常、定位问题,保障线上服务的稳定性。
前提条件
已创建智能搜索应用。
已登录 腾讯云 ES 控制台。
操作步骤
1. 选择应用,进入应用详情页,单击服务监控标签页。
2. 通过页面顶部的筛选条件定位需要查看的监控数据。
页面说明

筛选条件
筛选项 | 说明 |
时间范围 | 选择监控数据的起止时间,支持自定义时间段 |
时间粒度 | 数据聚合的时间精度,支持 1 分钟/5 分钟粒选项 |
监控类别 | 选择监控的服务类型,可选:应用服务、推理服务、ES 集群 |
原子服务类型 | 选择具体的原子服务类型,可选:文档解析、文本切片、查询分析、向量化、重排序、大模型生产 |
使用场景 | 选择服务的使用场景,可选:数据入库、在线测试、应用服务 |
文档库 | 筛选特定文档库的监控数据 |
应用服务
监控应用层面的整体运行情况,适用于已发布的独享服务,包含会话指标和服务资源两组指标。
会话指标
指标 | 说明 |
会话数(次) | 指定时间范围内服务接收到的会话请求总数 |
会话成功率(%) | 会话请求成功处理的比例,反映服务可用性 |
会话 QPM(次/min) | 每分钟会话请求数,反映服务的实时负载情况 |
会话 Token 输出速度(s) | 生成回答时每秒输出的 Token 数量,反映生成响应的速度 |
服务资源
指标 | 说明 |
CPU 分配量(核) | 当前独享服务分配的 CPU 核数 |
CPU 利用率(%) | CPU 实际使用量占分配量的比例 |
内存分配量(GB) | 当前独享服务分配的内存容量 |
内存利用率(%) | 内存实际使用量占分配量的比例 |
推理服务
监控原子模型推理服务的调用情况,包括文档解析、向量化等原子服务在不同使用场景下的表现。
指标 | 说明 |
请求量(次) | 指定时间范围内推理服务接收到的请求总数 |
Token 消耗(tokens) | 推理服务处理请求所消耗的 Token 总量,直接关联计费,LLM 会有输入和输出 Token 之分 |
解析页数(页) | 涉及文档解析的处理数量 |
图片识别(次) | 在调用文档解析接口时,开启图片识别次数 |
图片向量化(张) | 涉及图片向量化处理的请求次数 |
平均耗时(ms) | 推理服务处理单次请求的平均响应时间 |
成功率(%) | 推理请求成功处理的比例 |
异常率(%) | 推理请求处理失败或超时的比例 |
ES 集群
监控底层 Elasticsearch 集群的运行状态,分为文档库级别指标和集群级别指标两组。
文档库级别指标
指标 | 说明 |
查询速度(次/秒) | 当前文档库的查询 QPS |
写入速度(次/秒) | 当前文档库的写入 QPS |
集群级别指标
指标 | 说明 |
CPU 使用率(%) | 集群节点的 CPU 使用率 |
内存使用率(%) | 集群节点的内存使用率 |
硬盘存储使用率(%) | 集群节点的磁盘存储使用率 |
使用建议
日常巡检:关注会话成功率和推理服务成功率,持续低于 99% 时应排查原因。
性能调优:通过平均耗时和 Token 输出速度判断服务响应是否达标,结合 QPM 判断是否存在性能瓶颈。
资源评估:通过应用服务的 CPU/内存利用率评估当前资源配置是否合理,利用率持续偏高时考虑扩容。
成本监控:关注推理服务的 Token 消耗指标,结合资源包余量评估计费情况。
问题定位:通过切换监控类别(应用服务 → 推理服务 → ES 集群)逐层下钻,定位问题出现在哪个环节。
容量规划:结合 ES 集群的硬盘存储使用率和写入速度趋势,评估存储是否需要扩容。