概述
大模型的成本与性能是需持续观测才能控制的资源。与传统计算资源不同,其开销由 Token 驱动,随 Prompt 长度与模型选择大幅波动,且高度分散于众多业务、Key 与模型之间。若缺乏统一的度量视图,企业将面临几类典型的监控盲点:无法掌握各业务线的消耗量,无法判断缓存是否被有效复用,无法及时感知延迟劣化,亦无法在成本异常增长时第一时间告警。
可观测能力即用于消除上述盲点。其意义不止于将数据呈现为图表,更在于将分散的调用行为聚合为可支撑决策的洞察:使成本可归集到业务线,使性能劣化可被及时发现,使调度优化有据可依。本方案基于模型路由 CMR 的用量详情与日志服务仪表盘,构建覆盖用量与性能的可观测体系。CMR 内置的用量详情可满足即时观测;当需要长期留存或自定义维度时,则将日志投递至 CLS 并配置仪表盘。二者结合,使企业既可即时查看当前状态,亦可回溯与分析历史数据。
方案价值
可观测能力的价值最终体现于成本节约与服务稳定两项结果。下表所列各维度,均对应一条由数据到行动的路径。
维度 | 客户收益 | 支撑决策 |
用量透明 | 按用户维度和模型维度呈现 Token 消耗,成本可归集到业务线 | 成本分摊、预算调整 |
性能可视 | 观测延迟、首字时延、QPS,及时发现性能劣化 | 容量规划、瓶颈定位 |
异常预警 | 错误率、限流触发可视化并可配置告警 | 主动运维、故障止损 |
架构说明

可观测链路是一条由原始日志到多维洞察的处理流程。CMR 网关在处理每次调用时,产出包含用量、延迟等字段的调用日志与指标,并投递至 CLS;CLS 完成采集、结构化与实时检索后,在仪表盘中将原始事件聚合为按维度组织的分析视图。
在此基础上,告警将可观测由被动查看推进至主动响应:可为关键指标配置阈值,触发时通过短信和邮件等通知负责人,主动发现故障。并可与积分预算能力联动,构成监控与费控的完整成本治理。
前提条件
1. 已创建 CMR 模型路由实例,详细操作指导请参见 模型路由实例管理。
2. 已创建模型路由访问密钥,详细操作指导请参见 模型路由访问密钥。
3. 已创建 BYOK 实例,详细操作指导请参见 创建 BYOK 实例。
4. 如需控制积分消耗或调用速率,请提前创建对应的积分预算,详细操作指导请参见 配置积分预算。
5. 已开通 日志服务 CLS,创建日志集和日志主题。日志主题(Topic)是日志数据进行采集、存储、检索和分析的基本单元,日志集则是对日志主题的分类,方便用户管理日志主题。
操作步骤
步骤1:查看用量详情
1. 登录 模型路由 控制台,在实例管理页面,单击目标实例 ID,进入目标实例的实例管理页面。
2. 切换至用量详情页签,查看 Token 消耗、延迟等当前状态,满足即时观测需求。

步骤2:配置 CLS 日志投递
1. 在实例的实例管理页面,切换至日志页签。
2. 在模型路由日志处,单击立即启用。

3. 选择已有日志主题或创建日志主题,完成日志集和日志主题配置。

步骤3:查看多维仪表盘
1. 开启日志服务 CLS 后,控制台基于该日志主题自动创建仪表盘,包括以下三个维度:
核心用量:请求用量、积分用量、Token 用量。
性能指标:延迟指标、异常指标。
模型明细:模型调用明细、模型请求明细。

步骤4:闭环优化
1. 定期查看看板,针对缓存命中率低、长尾延迟高、某业务线用量突增等结论进行管理策略优化。
2. 与积分预算的费控能力联动,构成监控与费控的完整成本治理闭环。
相关文档
创建模型路由实例
配置模型调度管理
查看日志