首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >你的 token 账单,正在偷偷吃掉利润

你的 token 账单,正在偷偷吃掉利润

作者头像
瑭宋元
发布2026-09-17 21:50:17
发布2026-09-17 21:50:17
850
举报

50 万日活的产品,核心链路嵌一次旗舰调用,单日推理成本就能破九千美元——而你大概率没盯着它。

去年帮一家做 To C 工具的朋友看账单。他跟我炫耀:"我们全量接了 Claude,体验飞起。"我让他把推理那张发票拉出来——一天九千多刀。他当场沉默。那还只是核心链路"一次"调用,不是全部。 下面这句是我越来越确信的判断:2026 年的 CTO,得把 token 成本当 QPS、当 P99 延迟一样去盯。它不是"云存储那种便宜到可以忽略"的账,它是一条会随产品规模悄悄爬升、直到啃掉利润曲线尾端的隐形成本。

先算一笔账

九千刀,是怎么来的

腾讯云一个被反复引用的案例:日活 50 万的 To C 产品,在核心链路嵌一次 Claude Sonnet 调用,单次 2000 输入 + 800 输出 token。我按 2026 年 9 月的公开定价把它摊开算——

模型(单价 $/1M)

输入

输出

单次成本

日成本(50万次)

DeepSeek V4 Flash

0.14

0.28

$0.0005

$252

Claude Haiku 4.5

1.00

5.00

$0.006

$3,000

Claude Sonnet 4.6

3.00

15.00

$0.018

$9,000

GPT-5.6 Sol

4.00

20.00

$0.024

$12,000

Claude Opus 4.8

5.00

25.00

$0.030

$15,000

GPT-5.5

5.00

30.00

$0.034

$17,000

(假设 50 万日活、每活跃用户每天触发 1 次核心调用;真实产品往往是 3 到 5 倍。)

同一行代码,换模型,日成本从 252 刀到 1.7 万刀——差了 67 倍。而大多数团队的默认动作,是"先上最强的,体验优先",等账单到了才肉疼。旗舰模型的输入单价是预算模型的 35 倍,输出单价更是 100 倍以上。这中间的落差,就是利润被吃掉的缝隙。

真正吓人的在后面

看不见的二次曲线

上面的账,还只是"一次调用"。可凡是带对话、带 Agent 的产品,调用是连成串的。而大模型有个反直觉的脾气:它没记忆,每一轮都要把整段历史重新发回去。第一轮的提问,在第二、第三……第五十轮被反复付钱。

有人把这条规律称做"二次曲线陷阱"。累计输入 token 约等于 B×N + g×N(N−1)/2,那个 N² 项才是主角。摊开算(固定前缀 2500 token,每轮新增约 400):

10 轮对话,累计输入约 4.3 万 token,成本 6 分钱;50 轮,累计输入 61.5 万,成本 6 毛 9——历史重发已经占了账单的 80%;100 轮,累计输入 223 万,成本 2 块 4。轮数翻 10 倍,成本翻了 40 倍。到 200 轮,真实对话大概 8 万 token,却被计费 846 万输入 token——你写的每个字,平均付了 100 遍。

还有个更扎心的实测:一个 14 token 的问题,第 1 轮处理成本 0.18 分,到第 260 轮同样的问题要 2.41 刀——涨了 1339 倍。而用户自己敲的字,只占被处理 token 的 1.3%,剩下 98.7% 是系统提示词和一遍遍重发的历史。也就是说,你以为在为一句话付费,其实在为一整座越堆越高的上下文付复利。

钱去哪了

80% 的浪费,藏在选择里

2026 年有个被低估的事实:企业 AI 总预算里,推理已经占到 85% 以上。而同一批数据又指出,生产流量里大概 80% 的请求,根本用不着旗舰模型——分类、抽取、格式化、简单问答,小模型就能办。

我自己的判断是,很多团队不是不会省,是压根没把"路由"当架构来 design。上来全量旗舰,等于用法拉利跑全员通勤。Gartner 甚至预测,到 2027 年企业用专用小模型会是通用大模型的三倍。这不是模型变弱了,是流量本来就该分层。

有家法律科技公司把我上面这套做了减法:小模型(7B、4 位量化)吃下 80% 请求,复杂case才升到 70B。结果平均推理成本降了 63%,用户满意度 99.2%。成本砍掉一大截,体验反而没掉——因为那 80% 本来就不是难活。

解法已经跑通

分层推理,不是 PPT 概念

把"路由"当成一等的架构组件,做法已经很成熟,三档就够:

第一档,本地小模型。高频、低复杂度的意图——意图识别、字段抽取、格式转换——本地跑,零数据出网,成本只剩电费。这部分通常能吃掉 80% 的流量。

第二档,私有云中模型。需要点领域知识、但不必"世界级推理"的活——标准合同起草、技术文档摘要——交给中档模型,隐私和成本折中。

第三档,旗舰。只有高难度推理、多步规划、创意综合才升级,而且通常先过一道脱敏。最难的那 5%–15% 流量落在这里。

再加两道保险:提示词缓存——Claude 的缓存读比标准输入便宜 90%(Sonnet 从 3 掉到 0.30 / 1M),对固定系统提示词和多轮固定前缀简直是白捡;上下文封顶——给活跃窗口设上限,旧历史要么摘要、要么外置到向量库按需取,别让它无限重发。光这两招,很多场景的账单就能砍掉一半以上。

写给 CTO 的落地清单

别等账单教你做人

1. 把 token 成本当一阶指标:每个请求埋"单次成本 + 日成本",进监控面板,设告警。 2. 上路由层:三档模型,80% 走小/便宜模型,别全量旗舰。 3. 开提示词缓存 + 给上下文封顶,堵住二次曲线的口子。 4. 看"单任务成本"而非"每 token 单价"——一次 agentic 任务可能烧掉上百刀。 5. 给 Agent 设步数和工具调用硬上限,防失控循环把预算烧穿。 你的利润表,从来不是被一次大支出打穿的,是被一行行 token 悄悄吃空的。把它亮出来,你才知道钱去哪了。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-09-12,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档