按用量计费模式下的模型路由 CMR 实例收取处理费。实例创建成功,有业务处理以后会产生对应费用。
计费周期
按照模型路由 CMR 实例实际处理的 Token 量计费,每小时结算一次。
若用户创建实例后,完全不使用,则不会产生费用。
模型路由 CMR 实例收取的处理费不随上游模型单价变化,仅与您通过网关处理的总 Token 数量正相关。
模型路由 CMR 实例产生的处理费,仅支持通过资源包抵扣,详见 资源包介绍。
注意:
需要先购买资源包,才能创建按用量计费的 CMR 实例。
计费价格
地域 | 单价(元/百万 token) |
广州/上海/北京/新加坡/硅谷 | 0.49 |
计费公式
按用量计费实例费用计算公式如下:
CMR 处理费 = 处理费单价(元/百万 token) * 处理总 token 数(百万 token)
处理总 token 数 ≈ 上游模型返回 usage 中的 total_tokens。处理总 Token 数是指单次请求中,经过网关路由的所有输入 Token 与输出 Token 的总和。
说明:
total_tokens 由输入和输出两部分构成,以下都会计入处理费用中:
输入 Token (prompt_tokens):来源于 usage.prompt_tokens_details 的细项总和,包括:
非缓存的输入 Token。
输入 Token 读缓存。
输入 Token 写缓存。
输出 Token (completion_tokens):来源于 usage.completion_tokens_details 的细项总和,包括:
普通回复 Token (completion token)。
模型的推理/思考 Token (reasoning_tokens,如有)。
为完成工具调用所产生的额外 Token。
计费示例
场景:在广州地域创建一个按用量计费的 CMR 实例,2026年7月1日 00:00:00 创建成功,2026年7月1日 02:30:00 假设您通过我们的网关调用了一次上游模型(以 Kimi 为例)。
用户请求与上游模型响应示例:
{"id": "cmpl-a1b2c3d4e5f6a7b8c9d0e1f2","object": "chat.completion","created": 1774675200,"model": "kimi-k2-0905-preview","choices": [{"index": 0,"finish_reason": "stop","message": {"role": "assistant","content": "你好!"},"logprobs": null}],"usage": {"prompt_tokens": 98,"completion_tokens": 12,"total_tokens": 110,"prompt_tokens_details": {"cached_tokens": 64 // ← 缓存命中的 token 数,自动填充,是 prompt_tokens 的子集},"completion_tokens_details": {"reasoning_tokens": 0 // ← thinking 模型时此处非零,单价与普通 output 相同}}}
CMR 实例处理费用计算过程如下:
1. 确定总处理 Token 数:
网关从响应中提取 usage.total_tokens 字段,数值为110 Tokens。
2. 计算 Token 处理费:
总处理 Token 数 = 110 Tokens
处理费单价 = 0.49 元 / 百万 Token
CMR 处理费 = 110/1,000,000 * 0.49 ≈ 0.0000539 元
3. 对于此次调用,您将产生的模型路由处理费约为0.0000539元。无论本次调用的上游模型是 Kimi、GLM 还是 DeepSeek,只要处理的 Token 总数是110,此费用固定不变。