用户12781682
从 QPS 到 Token:模型服务接入后的流量治理
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
用户12781682
社区首页
>
专栏
>
从 QPS 到 Token:模型服务接入后的流量治理
从 QPS 到 Token:模型服务接入后的流量治理
用户12781682
关注
发布于 2026-09-26 21:31:57
发布于 2026-09-26 21:31:57
41
0
举报
概述
模型服务接入 Gateway 后,入口侧仍然可以使用 Request、QPS、错误率和延迟等指标,但 Serving 侧还会涉及 Token、Queue、KV Cache、模型质量和实例选择。本文沿着请求进入模型服务后的链路,讨论这些信息在流量治理中的位置和使用方式。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
云原生
API 网关
kubernetes
人工智能
架构设计
#模型服务流量治理
#QPS与Token
#AI Gateway
#推理实例选择
目录
QPS 与 Token 的分工
模型灰度中的质量判断
推理状态与实例选择
现有能力的衔接
参考资料
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档