操作场景
AI 网关对运行的网关实例提供了多维度的监控指标,用以全面监测实例运行状况与 AI 调用质量。监控指标涵盖通用网关性能指标(如请求数、时延、错误码)以及大模型场景特有的 LLM 指标(如 Token 消耗、模型响应耗时)。
您可以根据这些指标实时了解网关实例及各个模型 API 的运行状况,洞察AI调用成本与性能,针对可能存在的风险及时处理,保障 AI 服务的稳定性与成本可控性。本文为您介绍通过 TSF 控制台查看网关请求监控的操作。
操作步骤
1. 登录微服务平台控制台 ,在左侧导航栏选择 AI 网关进入实例列表。
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面。
3. 在左侧导航栏单击数据观测。
4. 单击页面顶部请求监控标签。
支持监控指标及含义
实例/节点
此部分指标适用于所有经过网关的流量,用于评估网关及后端服务的通用性能与健康状况。
指标名 | 指标含义 |
总请求数 | 总请求数。按照所选择的时间粒度统计求和。 |
请求平均时延 | 请求平均时延。按照所选择的时间粒度统计求平均值。 |
请求最大时延 | 请求最大时延。按照所选择的时间粒度统计求最大值。 |
网关直接返回的请求数 | 网关未转发到后端,直接返回响应的请求量(如鉴权失败、触发限流时)。按照所选择的时间粒度统计求和。 |
网关平均时延 | 网关自身处理请求的平均耗时。 |
网关最大时延 | 网关自身处理请求的最大耗时。 |
2xx请求数 | 客户端发送到 AI 网关,请求成功的次数(如 200 OK),按照所选择的时间粒度统计求和。 |
3xx请求数 | 客户端发送到 AI 网关,请求重定向的次数,按照所选择的时间粒度统计求和。 |
4xx请求数 | 客户端发送到 AI 网关的是非法请求,如鉴权不通过或者超过限流值的错误个数,网关直接返回的客户端错误的个数(如 401 鉴权失败、403 权限不足、429 限流)。按照所选择的时间粒度统计求和。 |
5xx请求数 | AI 网关将消息转发到后端服务,后端服务返回的服务端错误的个数(如 500 后端异常、502 后端无效响应、504 后端不可达)。按照所选择的时间粒度统计求和。 |
403请求数 | 权限错误,后端有能力处理该请求,但是拒绝授权访问 |
404请求数 | 请求后端服务失败,请求所希望的资源未在后端服务器上发现,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
429请求数 | 请求后端服务失败,请求被限流,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
499请求数 | 请求后端服务失败,客户端在后端响应前主动断开连接,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
502请求数 | 网关尝试执行后端请求时,从后端服务器接收到无效的响应(通常连接服务失败),此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
504请求数 | 网关尝试执行后端请求时,后端机器不可达,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
网关转到后端的请求数 | 网关成功转发到后端服务的请求量。按照所选择的时间粒度统计求和。 |
后端平均时延 | 后端服务处理请求的平均耗时。按照所选择的时间粒度统计求平均值。 |
后端最大时延 | 后端服务处理请求的最大耗时。按照所选择的时间粒度统计求最大值。 |
后端2xx请求数 | 后端服务请求成功的次数(如 200 OK),按照所选择的时间粒度统计求和。 |
后端3xx请求数 | 后端服务请求重定向的次数,按照所选择的时间粒度统计求和。 |
后端4xx请求数 | 后端服务是非法请求的次数。按照所选择的时间粒度统计求和。 |
后端5xx请求数 | 后端服务返回的服务端错误的个数(如 500 后端异常、502 后端无效响应、504 后端不可达)。按照所选择的时间粒度统计求和。 |
后端404请求数 | 后端服务资源未在后端服务器上发现,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
后端429请求数 | 后端服务请求失败,请求被限流,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
后端499请求数 | 后端服务请求失败,客户端在后端响应前主动断开连接,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
后端502请求数 | 后端服务请求失败,后端服务接收到无效的响应,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
后端504请求数 | 后端服务请求失败,后端机器不可达,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
模型 API
此部分指标专门用于监控大模型调用场景,帮助您分析 Token 消耗成本与模型提供商性能。
指标名 | 指标含义 |
LLM HTTP 请求次数 | 网关向大模型供应商发起的 HTTP 调用次数。此指标直接反映模型 API 的调用频次。 |
LLM 总消耗 Token 数 | 网关消耗大模型供应商的总 Token 数,即输入(Prompt)与输出(Completion)的实际消耗 Token 数之和。用于评估消耗 Token 总数据吞吐量。 |
LLM prompt 消耗 token 数 | 大模型在处理请求时,模型实际所消耗的输入(Prompt)部分的总 Token 数。 |
LLM completion 消耗 token 数 | 大模型在生成回复时,模型实际所消耗的输出(Completion)部分的总 Token 数。此指标是评估模型调用成本的核心依据之一。 |
LLM 模型每次请求平均耗时(ms) | 从网关发送请求到模型提供商,到收到其完整响应的平均耗时。此指标反映模型提供商的端到端响应性能。 |
LLM 提供商平均每 token 耗时(ms) | 模型提供商平均消耗每个 Token 所花费的时间,此指标反映模型提供商 Token 的消耗速度。 |
MCP
此部分指标用于监控 MCP 服务的运行状况。通过该页面,您可以查看各 MCP 服务的调用情况,包括请求次数、平均耗时和请求成功率,以便快速发现异常并进行容量评估。
指标名 | 指标含义 |
MCP 请求次数 | MCP 服务在所选时间范围内接收到的请求总数。此指标直接反映 MCP Server 的调用频次。 |
MCP 请求平均耗时(ms) | MCP 服务处理请求的平均耗时(毫秒)。此指标反映 MCP Server 的性能表现。 |
MCP 请求成功率(%) | MCP 服务调用成功的请求数占总请求数的百分比。此指标反映 MCP Server 的稳定性。 |