概述
大模型进入生产环境后,可用性取代效果成为首要约束。生产环境中的不可用主要来自两个相互独立的方向:其一为自建算力,GPU 节点可能因显存溢出、或驱动异常而中断服务;其二为商用 API,可能因限流、区域抖动或厂商侧故障而超时。任何单一来源均难以独立支撑 SLA,而全部采用商用模型又将牺牲成本与自主性。
模型路由 CMR 将不同性质的算力来源组合为一套互补架构,使其失效模式尽量相互独立,再由统一入口在其间自动调度。该组合的核心在于将成本与可用性分层承载。常态流量的绝大部分由低成本的自建模型承接,仅在主用渠道失效时,流量才转移至按量计费的商用模型。企业由此同时获得自建算力的成本优势与商用平台的可用性保障,且上层业务对切换过程无感知,仅对接统一的 API 入口。本方案据此设计:
主用渠道采用高性能应用服务 HAI 上自部署的开源模型,兼顾成本与自主可控;
备用渠道采用大模型服务平台 TokenHub 的商用模型,以商用 SLA 覆盖极端情况;
入口采用模型路由 CMR,通过路由策略在主备渠道之间实现秒级、无感的自动切换。
方案价值
评估高可用架构不应仅关注常态成本,还须关注故障损失。CMR 将“路由”与“容灾”拆分为两套可独立配置的策略,使成本效率与可用性下限得以分别优化。从投入产出角度看,本方案将“容灾”由一项需专门投入研发的工程,转化为网关配置。业务代码无需维护复杂的重试与降级逻辑,亦无需为冗余常备两套满负荷算力。备用渠道在常态下几乎不产生成本,仅在实际触发时计费,从而显著降低高可用的边际成本。
维度 | 客户收益 | 实现机制 |
高可用 | 主用 HAI 异常时自动切换至 TokenHub,业务无感知,可用性由多来源叠加保障。 | 健康探测 |
成本优化 | 常态流量走自建低成本算力,仅在故障或峰值时转移至商用模型。 | 最低系数路由 |
统一入口 | 业务侧对接单一网关与协议,无需自行实现重试、熔断与容灾逻辑。 | 统一协议接入 |
弹性互补 | HAI 分钟级扩容、TokenHub 按量弹性,二者失效模式相互独立。 | 异构编排 |
架构说明

架构由一个入口、两类来源构成。业务应用携带 API Key 请求 CMR 网关;网关依据最低系数路由策略,将流量优先下发至模型系数低的 HAI 自部署模型;当主用渠道异常时,网关将请求切换至 TokenHub 商用模型。主用侧侧重成本与自主,备用侧侧重 SLA 与弹性,二者构成兼具性能与可用性的调用链。
请求进入 CMR 网关后依次经过意图路由、L1 模型间路由(决定在 HAI 与 TokenHub 等不同模型之间的分发)、L2 模型内路由(决定同一模型下多个 BYOK Key 之间的分发),最终调用模型并返回响应。为保证切换后的体验一致,主备模型在上下文长度与能力等级上应尽量对齐,避免更换模型时出现明显的效果落差。这是本架构在可用性之外,对质量一致性作出的必要权衡。
前提条件
1. 已在高性能应用服务 HAI 上部署模型,暴露 OpenAI 兼容访问地址与 API Key。主用模型建议多节点部署,避免成为单点。具体操作请参见 创建 BYOK 实例。
2. 已开通大模型服务平台 TokenHub,获取可用的备用模型与 API Key,并确认备用模型的能力与上下文长度与主用模型相当。具体操作请参见 创建 BYOK 实例。
3. 已在 VPC 内完成私有模型部署。模型对外暴露 OpenAI 兼容接口。
操作步骤
步骤1:准备主用渠道(HAI)
1. 登录 高性能应用服务 HAI 控制台,部署开源模型,开启多节点部署避免单点。请参考 HAI 快速入门 。
2. 记录模型暴露的 OpenAI 兼容访问地址 与 API Key,确认上下文长度与能力满足业务要求。
步骤2:准备备用渠道(TokenHub)
1. 开通大模型服务平台 TokenHub,获取可用的备用商用模型清单与 API Key。请参考 TokenHub 快速入门 。
2. 确认备用模型的上下文长度、能力等级与主用 HAI 模型相当,避免切换模型时出现明显效果落差。
步骤3:创建 CMR 实例
1. 登录 模型路由 控制台进入实例管理,单击新建。

2. 实例类型选择企业型,并完成基础配置。

步骤4:添加 BYOK 模型提供商
1. 登录 模型路由 控制台进入 BYOK 管理,单击新建。

2. 在实例模型提供商中分别添加:
HAI 自建模型:选择自定义模型,完成模型配置。在积分管理中为该模型配置低系数。

TokenHub 商用模型:选择腾讯云 TokenHub ,并完成模型配置。在积分管理中为该模型配置高于 HAI 的系数。

步骤5:配置模型间路由侧策略
1. 登录 模型路由 控制台进入实例管理。在实例管理页面,单击目标实例 ID,进入目标实例的基本信息页面。
2. 切换至模型调度管理页签,在路由策略示意图中的关联模型节点,单击关联。或在关联模型页面单击去关联。

4. 在路由策略示意图中的模型间路由节点,单击切换,选择最低系数路由。

步骤6:验证结果
1. 可停止 HAI 节点,观察请求是否自动切换至 TokenHub 且业务无感知。请确保停止节点不影响业务,该行为可测试路由策略,正常使用无需停止。
2. 在用量详情页签监控模型调用量,持续评估主用渠道稳定性。
相关文档
创建模型路由实例
配置模型调度管理
配置模型系数
查看用量详情