AI 网关支持按节点规格和数量购买。本文介绍 AI 网关的性能指标,请根据业务需求选择合适的资源大小。
网关运行水位
网关运行水位说明如下:
推荐水位:CPU 使用率为30%,内存使用率为30%。
警戒水位:CPU 使用率为60%,内存使用率为60%。
在日常运行中,建议将资源使用率控制在30-60%,既可以保持较高的资源利用率,又可以应对请求突增的情况。在警戒水位下,网关可以获得完整的 SLA 保障。当运行水位超过警戒水位时,网关进入高负载状态,请求成功率和耗时可能受到影响,建议配置告警。
网关容量指标
节点规格和数量决定网关容量,增大节点规格或者增加节点数量可以提高网关容量。如果节点规格不变,随着节点数量的增长,网关容量基本保持线性增长。网关容量指标说明如下:
连接数:网关支持的最大连接数量。
QPS:网关每秒处理/转发的业务请求总数。
Token 并发数:网关同时处理的请求中,可支撑的最大 Token 并发生成数。
节点规格 | 1核2G | 2核4G | 4核8G | 8核16G | 16核32G | |
节点数量 | | 2节点 | 2节点 | 2节点 | 2节点 | 2节点 |
连接数 | 推荐水位 | 12000 | 24000 | 48000 | 96000 | 192000 |
| 警戒水位 | 14400 | 28800 | 57600 | 115200 | 230400 |
QPS | 推荐水位 | 1750 | 2225 | 7750 | 10300 | 125000 |
| 警戒水位 | 2000 | 2550 | 8000 | 15000 | 200000 |
Token 并发数 | 推荐水位 | 1000 | 1000 | 1000 | 30000 | 35000 |
| 警戒水位 | 2000 | 2000 | 2000 | 50000 | 50000 |
网关性能数据
测试场景:客户端发送请求给网关,网关转发到后端服务器,后端服务器直接返回响应。
测试条件:不同的协议类型、连接类型和 Token 分级(Token 分级对应输出 Token 数量,如 L1 约30tokens,L2 约2000tokens)。
测试结果:客户端请求 QPS 如下所示,基于推荐水位(30%负载)下的达标 QPS。请求平均耗时小于 5 毫秒。CPU 和内存使用率处于推荐水位(30%)。
CPU 和内存使用率均处于推荐水位(30%) | ||||||||||
协议类型 | 连接类型 | Token | 1 核 2G | | 2 核 4G | | 4 核 8G | | | |
| | | 2 节点 | 3节点 | 2 节点 | 3节点 | 2 节点 | 3节点 | | |
HTTP | 短连接 | 30 | 1600 | 2500 | 1500 | 2500 | 4300 | 4800 | | |
| | 2000 | 1500 | 2200 | 1400 | 2400 | 3000 | 2200 | | |
| 长连接 | 30 | 650 | 900 | 500 | 900 | 900 | 1400 | | |
| | 2000 | 600 | 800 | 430 | 800 | 800 | 1300 | | |
HTTPS | 短连接 | 30 | 900 | 1300 | 800 | 1100 | 1350 | 2400 | | |
| | 2000 | 900 | 1000 | 600 | 1000 | 1600 | 2200 | | |
| 长连接 | 30 | 580 | 1000 | 900 | 880 | 850 | 1500 | | |
| | 2000 | 550 | 1000 | 860 | 700 | 800 | 1000 | | |