帮你快速理解、总结文档立即下载

Token 长度路由

最近更新时间:2026-07-24 16:45:01

我的收藏

操作场景

基于 Token 长度的智能路由是一种根据请求 Token 数量自动选择更加适合当前模型服务的路由策略。系统接收用户请求后,自动估算请求的 Token 长度,根据预设的分段规则匹配目标模型,实现成本与性能的最优平衡。
典型场景:
多模型成本优化:企业同时接入 GPT-4(短上下文,成本高)、Claude(中长上下文,成本中)、Gemini(超长上下文,成本低),根据请求 Token 长度自动选择最经济的模型
长短文本分流:短文本请求(如 0-4K Token)路由到经济型模型,长文本请求(如 32K+)路由到长上下文模型,避免截断和成本浪费

前提条件

已创建 AI 网关实例且处于运行中状态。
已配置多个模型服务(作为候选服务池)。
已明确预期进行分段的 Token 长度值。

操作步骤

步骤 1:进入模型 API 配置页

1. 登录微服务平台控制台,在左侧导航栏单击 AI 网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 选择左侧导航栏模型管理 > 模型 API;
4. 单击新建或编辑已有 API;
5. 完成基本信息配置后,进入第二步:选择模型服务。

步骤 2:选择服务类型和路由策略

1. 选择服务类型多模型服务;
2. 若您需要先筛选候选服务池,可启用标签过滤(可选)。开启后,将根据标签筛选符合条件的模型服务;不启用标签过滤时,候选服务池为全部模型服务列表。
过滤模式:选择 AND(服务必须同时满足所有标签) 或 OR(服务满足任意一个标签即可)。推荐使用 AND。
标签配置:单击添加标签,填写标签的 Key 和 Value。
3. 路由策略区域,选择 Token 长度路由。

步骤 3:选择 Tokenizer 编码

选择模型对应的分词规则,不同的编码会直接影响 Token 数量、API 费用以及中文处理效率。请根据你实际使用的模型进行选择:
编码
推荐场景
特点
o200k_base(推荐)
GPT-4o / o1 / o3 / GPT-5 系列
最新、最省成本。对中文支持最好,相同的中文内容消耗的 Token 更少。
cl100k_base​
GPT-4 / GPT-3.5 / Claude 系列
通用兼容。适合旧版 OpenAI 模型或与 Claude 对齐 Token 计数。
p50k_base
早期 GPT-3 / Codex
偏向代码处理,中文效率低,仅用于旧系统维护。
r50k_base
早期 GPT-2 / GPT-3
最古老的编码,中文消耗极大,一般不建议选择。

步骤4:配置默认目标

Token 计数失败、规则为空或未命中任何分段规则时,使用此默认目标。
1. 选择二级路由策略:单模型服务、权重路由、延迟优先路由。
2. 根据所选二级路由策略完成后续配置。

步骤5:配置分段规则

1. 在分段规则区域,按 Token 长度区间配置多个分段,为每个分段设置以下参数:
Token 长度区间: [分段包含的最小 Token 数,分段包含的最大 Token 数]。前一分段的上界即为下一分段的下界,分段必须连续,不允许区间重叠
典型配置示例:
短文本:[1, 100] / [101, 500] / [501, 2000]
中等文本:[1, 1000] / [1001, 8000] / [8001, 32000]
长文本:[1, 4000] / [4001, 32000] / [32001, 200000]
二级路由策略:单模型服务、权重路由、延迟优先路由。
根据所选二级路由策略完成后续配置。分段内配置多个模型时,自动按所选策略在多模型间分发。
2. 支持单击添加分段规则增加新分段。

步骤6:确认并保存

单击确定保存配置,通过配置合法性检验后智能路由策略生效。