帮你快速理解、总结文档立即下载

查看请求监控

最近更新时间:2026-07-24 16:45:00

我的收藏

操作场景

AI 网关对运行的网关实例提供了多维度的监控指标,用以全面监测实例运行状况与 AI 调用质量。监控指标涵盖通用网关性能指标(如请求数、时延、错误码)以及大模型场景特有的 LLM 指标(如 Token 消耗、模型响应耗时)。
您可以根据这些指标实时了解网关实例及各个模型 API 的运行状况,洞察AI调用成本与性能,针对可能存在的风险及时处理,保障 AI 服务的稳定性与成本可控性。本文为您介绍通过 TSF 控制台查看网关请求监控的操作。

操作步骤

1. 登录微服务平台控制台 ,在左侧导航栏选择 AI 网关进入实例列表。
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面。
3. 在左侧导航栏单击数据观测。
4. 单击页面顶部请求监控标签。

支持监控指标及含义

实例/节点

此部分指标适用于所有经过网关的流量,用于评估网关及后端服务的通用性能与健康状况。
指标名
指标含义
总请求数
总请求数。按照所选择的时间粒度统计求和。
请求平均时延
请求平均时延。按照所选择的时间粒度统计求平均值。
请求最大时延
请求最大时延。按照所选择的时间粒度统计求最大值。
网关直接返回的请求数
网关未转发到后端,直接返回响应的请求量(如鉴权失败、触发限流时)。按照所选择的时间粒度统计求和。
网关平均时延
网关自身处理请求的平均耗时。
网关最大时延
网关自身处理请求的最大耗时。
2xx请求数
客户端发送到 AI 网关,请求成功的次数(如 200 OK),按照所选择的时间粒度统计求和。
3xx请求数
客户端发送到 AI 网关,请求重定向的次数,按照所选择的时间粒度统计求和。
4xx请求数
客户端发送到 AI 网关的是非法请求,如鉴权不通过或者超过限流值的错误个数,网关直接返回的客户端错误的个数(如 401 鉴权失败、403 权限不足、429 限流)。按照所选择的时间粒度统计求和。
5xx请求数
AI 网关将消息转发到后端服务,后端服务返回的服务端错误的个数(如 500 后端异常、502 后端无效响应、504 后端不可达)。按照所选择的时间粒度统计求和。
403请求数
权限错误,后端有能力处理该请求,但是拒绝授权访问
404请求数
请求后端服务失败,请求所希望的资源未在后端服务器上发现,此类错误的个数的统计,按照所选择的时间粒度统计求和。
429请求数
请求后端服务失败,请求被限流,此类错误的个数的统计,按照所选择的时间粒度统计求和。
499请求数
请求后端服务失败,客户端在后端响应前主动断开连接,此类错误的个数的统计,按照所选择的时间粒度统计求和。
502请求数
网关尝试执行后端请求时,从后端服务器接收到无效的响应(通常连接服务失败),此类错误的个数的统计,按照所选择的时间粒度统计求和。
504请求数
网关尝试执行后端请求时,后端机器不可达,此类错误的个数的统计,按照所选择的时间粒度统计求和。
网关转到后端的请求数
网关成功转发到后端服务的请求量。按照所选择的时间粒度统计求和。
后端平均时延
后端服务处理请求的平均耗时。按照所选择的时间粒度统计求平均值。
后端最大时延
后端服务处理请求的最大耗时。按照所选择的时间粒度统计求最大值。
后端2xx请求数
后端服务请求成功的次数(如 200 OK),按照所选择的时间粒度统计求和。
后端3xx请求数
后端服务请求重定向的次数,按照所选择的时间粒度统计求和。
后端4xx请求数
后端服务是非法请求的次数。按照所选择的时间粒度统计求和。
后端5xx请求数
后端服务返回的服务端错误的个数(如 500 后端异常、502 后端无效响应、504 后端不可达)。按照所选择的时间粒度统计求和。
后端404请求数
后端服务资源未在后端服务器上发现,此类错误的个数的统计,按照所选择的时间粒度统计求和。
后端429请求数
后端服务请求失败,请求被限流,此类错误的个数的统计,按照所选择的时间粒度统计求和。
后端499请求数
后端服务请求失败,客户端在后端响应前主动断开连接,此类错误的个数的统计,按照所选择的时间粒度统计求和。
后端502请求数
后端服务请求失败,后端服务接收到无效的响应,此类错误的个数的统计,按照所选择的时间粒度统计求和。
后端504请求数
后端服务请求失败,后端机器不可达,此类错误的个数的统计,按照所选择的时间粒度统计求和。

模型 API

此部分指标专门用于监控大模型调用场景,帮助您分析 Token 消耗成本与模型提供商性能。
指标名
指标含义
LLM HTTP 请求次数​
网关向大模型供应商发起的 HTTP 调用次数。此指标直接反映模型 API 的调用频次。
LLM 总消耗 Token 数
网关消耗大模型供应商的总 Token 数,即输入(Prompt)与输出(Completion)的实际消耗 Token 数之和。用于评估消耗 Token 总数据吞吐量。
LLM prompt 消耗 token 数​
大模型在处理请求时,模型实际所消耗的输入(Prompt)部分的总 Token 数。
LLM completion 消耗 token 数​
大模型在生成回复时,模型实际所消耗的输出(Completion)部分的总 Token 数。此指标是评估模型调用成本的核心依据之一。
LLM 模型每次请求平均耗时(ms)
从网关发送请求到模型提供商,到收到其完整响应的平均耗时。此指标反映模型提供商的端到端响应性能。
LLM 提供商平均每 token 耗时(ms)
模型提供商平均消耗每个 Token 所花费的时间,此指标反映模型提供商 Token 的消耗速度。

MCP

此部分指标用于监控 MCP 服务的运行状况。通过该页面,您可以查看各 MCP 服务的调用情况,包括请求次数、平均耗时和请求成功率,以便快速发现异常并进行容量评估。
指标名
指标含义
MCP 请求次数
MCP 服务在所选时间范围内接收到的请求总数。此指标直接反映 MCP Server 的调用频次。
MCP 请求平均耗时(ms)
MCP 服务处理请求的平均耗时(毫秒)。此指标反映 MCP Server 的性能表现。
MCP 请求成功率(%)
MCP 服务调用成功的请求数占总请求数的百分比。此指标反映 MCP Server 的稳定性。