帮你快速理解、总结文档立即下载
文档中心>模型路由>最佳实践>HAI 与 TokenHub 高可用架构

HAI 与 TokenHub 高可用架构

最近更新时间:2026-09-15 15:34:31
本文档已由 AI 辅助审校
我的收藏

概述

大模型进入生产环境后,可用性取代效果成为首要约束。生产环境中的不可用主要来自两个相互独立的方向:其一为自建算力,GPU 节点可能因显存溢出、或驱动异常而中断服务;其二为商用 API,可能因限流、区域抖动或厂商侧故障而超时。任何单一来源均难以独立支撑 SLA,而全部采用商用模型又将牺牲成本与自主性。
模型路由 CMR 将不同性质的算力来源组合为一套互补架构,使其失效模式尽量相互独立,再由统一入口在其间自动调度。该组合的核心在于将成本与可用性分层承载。常态流量的绝大部分由低成本的自建模型承接,仅在主用渠道失效时,流量才转移至按量计费的商用模型。企业由此同时获得自建算力的成本优势与商用平台的可用性保障,且上层业务对切换过程无感知,仅对接统一的 API 入口。本方案据此设计:
主用渠道采用高性能应用服务 HAI 上自部署的开源模型,兼顾成本与自主可控;
备用渠道采用大模型服务平台 TokenHub 的商用模型,以商用 SLA 覆盖极端情况;
入口采用模型路由 CMR,通过路由策略在主备渠道之间实现秒级、无感的自动切换。

方案价值

评估高可用架构不应仅关注常态成本,还须关注故障损失。CMR 将“路由”与“容灾”拆分为两套可独立配置的策略,使成本效率与可用性下限得以分别优化。从投入产出角度看,本方案将“容灾”由一项需专门投入研发的工程,转化为网关配置。业务代码无需维护复杂的重试与降级逻辑,亦无需为冗余常备两套满负荷算力。备用渠道在常态下几乎不产生成本,仅在实际触发时计费,从而显著降低高可用的边际成本。
维度
客户收益
实现机制
高可用
主用 HAI 异常时自动切换至 TokenHub,业务无感知,可用性由多来源叠加保障。
健康探测
成本优化
常态流量走自建低成本算力,仅在故障或峰值时转移至商用模型。
最低系数路由
统一入口
业务侧对接单一网关与协议,无需自行实现重试、熔断与容灾逻辑。
统一协议接入
弹性互补
HAI 分钟级扩容、TokenHub 按量弹性,二者失效模式相互独立。
异构编排

架构说明


架构由一个入口、两类来源构成。业务应用携带 API Key 请求 CMR 网关;网关依据最低系数路由策略,将流量优先下发至模型系数低的 HAI 自部署模型;当主用渠道异常时,网关将请求切换至 TokenHub 商用模型。主用侧侧重成本与自主,备用侧侧重 SLA 与弹性,二者构成兼具性能与可用性的调用链。
请求进入 CMR 网关后依次经过意图路由、L1 模型间路由(决定在 HAI 与 TokenHub 等不同模型之间的分发)、L2 模型内路由(决定同一模型下多个 BYOK Key 之间的分发),最终调用模型并返回响应。为保证切换后的体验一致,主备模型在上下文长度与能力等级上应尽量对齐,避免更换模型时出现明显的效果落差。这是本架构在可用性之外,对质量一致性作出的必要权衡。

前提条件

1. 已在高性能应用服务 HAI 上部署模型,暴露 OpenAI 兼容访问地址与 API Key。主用模型建议多节点部署,避免成为单点。具体操作请参见 创建 BYOK 实例
2. 已开通大模型服务平台 TokenHub,获取可用的备用模型与 API Key,并确认备用模型的能力与上下文长度与主用模型相当。具体操作请参见 创建 BYOK 实例
3. 已在 VPC 内完成私有模型部署。模型对外暴露 OpenAI 兼容接口。
4. 已创建 CMR 实例并关联上述模型。具体操作请参见 创建模型路由实例配置模型调度管理

操作步骤

步骤1:准备主用渠道(HAI)

1. 登录 高性能应用服务 HAI 控制台,部署开源模型,开启多节点部署避免单点。请参考 HAI 快速入门
2. 记录模型暴露的 OpenAI 兼容访问地址 API Key,确认上下文长度与能力满足业务要求。

步骤2:准备备用渠道(TokenHub)

1. 开通大模型服务平台 TokenHub,获取可用的备用商用模型清单与 API Key。请参考 TokenHub 快速入门
2. 确认备用模型的上下文长度、能力等级与主用 HAI 模型相当,避免切换模型时出现明显效果落差。

步骤3:创建 CMR 实例

1. 登录 模型路由 控制台进入实例管理,单击新建

2. 实例类型选择企业型,并完成基础配置。


步骤4:添加 BYOK 模型提供商

1. 登录 模型路由 控制台进入 BYOK 管理,单击新建

2. 在实例模型提供商中分别添加:
HAI 自建模型:选择自定义模型,完成模型配置。在积分管理中为该模型配置低系数。

TokenHub 商用模型:选择腾讯云 TokenHub ,并完成模型配置。在积分管理中为该模型配置高于 HAI 的系数。


步骤5:配置模型间路由侧策略

1. 登录 模型路由 控制台进入实例管理。在实例管理页面,单击目标实例 ID,进入目标实例的基本信息页面。
2. 切换至模型调度管理页签,在路由策略示意图中的关联模型节点,单击关联。或在关联模型页面单击去关联
3. 步骤3 添加的 HAI 主用模型和 步骤4 添加的 TokenHub 备用模型均加入关联列表。

4. 路由策略示意图中的模型间路由节点,单击切换,选择最低系数路由。


步骤6:验证结果

1. 可停止 HAI 节点,观察请求是否自动切换至 TokenHub 且业务无感知。请确保停止节点不影响业务,该行为可测试路由策略,正常使用无需停止。
2. 在用量详情页签监控模型调用量,持续评估主用渠道稳定性。

相关文档