操作场景
流量镜像允许您在不影响线上用户的前提下,将模型 API 的部分生产请求异步复制到镜像模型服务,后台采集镜像模型的性能元数据(TTFT、TPOT、Token 数量、预估成本等),并与主模型进行并排对比。适用于以下场景:
评估新候选模型的性能,为模型切换提供数据支撑。
验证新模型的延迟和吞吐量是否满足生产要求。
用真实生产流量做性能对比,避免“沙盒好用、上线翻车”。
前提条件
已创建 AI 网关实例。
已创建模型 API。
已配置至少两个模型服务(一个作为主模型服务,一个作为镜像模型服务)。
镜像模型服务所使用的供应商 API Key 已配置且有效。
已开启 CLS 日志投递的 LLM 访问日志投递能力,详情请参见 CLS 日志投递。
操作步骤
步骤1:进入目标 API 流量镜像配置页
1. 登录 微服务平台控制台 ,左侧导航栏选择 AI 网关进入实例列表。
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面。
3. 在左侧导航栏单击模型管理,单击模型 API 页签。
4. 单击目标模型 API 名称(已创建的 API),进入其详情页,单击流量镜像 > 配置流量镜像。

步骤2:配置流量镜像
1. 开启流量镜像开关,展开配置区域。
2. 在镜像目标下拉框中选择作为镜像目标的模型服务。
3. 设置镜像比例,默认值:10%,低于 100% 时系统按比例随机抽样决定是否镜像当前请求。
建议值:
场景 | 建议比例 |
生产环境长期评估 | 10-30% |
临时调试、验证 | 100% |
首次开启测试 | 5-10% |
说明:
镜像目标服务不能与主路径模型服务相同;
镜像目标服务独立于主路径,不参与主路径的 Fallback 和智能路由。
4. 在数据观测区域,勾选需要采集的性能指标(默认全选):
首 Token 时间 (TTFT):从请求到收到第一个 Token 的时间。
每 Token 耗时 (TPOT):解码阶段平均每个输出 Token 的生成时间。
Token 数量 (Prompt + Completion):输入和输出的 Token 数量。
预估成本:基于 Token 数量和模型单价计算的预估费用。
说明:
数据观测功能依赖 CLS 日志投递的 LLM 访问日志投递能力,请确保已开启。
步骤3:保存配置
单击确定保存配置,保存后配置立即生效。
注意:
1. 镜像会产生额外费用:每次镜像请求会对镜像模型服务产生实际调用及对应 Token 费用,请提前评估成本。
2. 建议先小比例测试:首次开启建议设置镜像比例为 5-10%,确认镜像运行正常后再调高。
3. 镜像模型服务需足够容量:若镜像比例较高(>50%),请确保镜像模型服务有足够的并发承载能力。
4. 镜像数据不含质量评估:流量镜像仅采集性能元数据(TTFT/TPOT/Token/成本),响应质量评估需结合人工评审或外部评测工具。