首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >从 QPS 到 Token:模型服务接入后的流量治理

从 QPS 到 Token:模型服务接入后的流量治理

作者头像
用户12781682
发布于 2026-09-26 21:31:57
发布于 2026-09-26 21:31:57
410
举报
概述
模型服务接入 Gateway 后,入口侧仍然可以使用 Request、QPS、错误率和延迟等指标,但 Serving 侧还会涉及 Token、Queue、KV Cache、模型质量和实例选择。本文沿着请求进入模型服务后的链路,讨论这些信息在流量治理中的位置和使用方式。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • QPS 与 Token 的分工
  • 模型灰度中的质量判断
  • 推理状态与实例选择
  • 现有能力的衔接
  • 参考资料
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档