帮你快速理解、总结文档立即下载

性能评估

最近更新时间:2026-07-23 17:07:33

我的收藏
AI 网关支持按节点规格和数量购买。本文介绍 AI 网关的性能指标,请根据业务需求选择合适的资源大小。

网关运行水位

网关运行水位说明如下:
推荐水位:CPU 使用率为30%,内存使用率为30%。
警戒水位:CPU 使用率为60%,内存使用率为60%。
在日常运行中,建议将资源使用率控制在30-60%,既可以保持较高的资源利用率,又可以应对请求突增的情况。在警戒水位下,网关可以获得完整的 SLA 保障。当运行水位超过警戒水位时,网关进入高负载状态,请求成功率和耗时可能受到影响,建议配置告警。

网关容量指标

节点规格和数量决定网关容量,增大节点规格或者增加节点数量可以提高网关容量。如果节点规格不变,随着节点数量的增长,网关容量基本保持线性增长。网关容量指标说明如下:
连接数:网关支持的最大连接数量。
QPS:网关每秒处理/转发的业务请求总数。
Token 并发数:网关同时处理的请求中,可支撑的最大 Token 并发生成数。
节点规格
1核2G
2核4G
4核8G
8核16G
16核32G
节点数量
2节点
2节点
2节点
2节点
2节点
连接数
推荐水位
12000
24000
48000
96000
192000
警戒水位
14400
28800
57600
115200
230400
QPS
推荐水位
1750
2225
7750
10300
125000
警戒水位
2000
2550
8000
15000
200000
Token 并发数
推荐水位
1000
1000
1000
30000
35000
警戒水位
2000
2000
2000
50000
50000

网关性能数据

测试场景:客户端发送请求给网关,网关转发到后端服务器,后端服务器直接返回响应。
测试条件:不同的协议类型、连接类型和 Token 分级(Token 分级对应输出 Token 数量,如 L1 约30tokens,L2 约2000tokens)。
测试结果:客户端请求 QPS 如下所示,基于推荐水位(30%负载)下的达标 QPS。请求平均耗时小于 5 毫秒。CPU 和内存使用率处于推荐水位(30%)。
CPU 和内存使用率均处于推荐水位(30%)
协议类型
连接类型
Token
1 核 2G
2 核 4G
4 核 8G


2 节点
3节点
2 节点
3节点
2 节点
3节点


HTTP
短连接
30
1600
2500
1500
2500
4300
4800


2000
1500
2200
1400
2400
3000
2200


长连接
30
650
900
500
900
900
1400


2000
600
800
430
800
800
1300


HTTPS
短连接
30
900
1300
800
1100
1350
2400


2000
900
1000
600
1000
1600
2200


长连接
30
580
1000
900
880
850
1500


2000
550
1000
860
700
800
1000