50 万日活的产品,核心链路嵌一次旗舰调用,单日推理成本就能破九千美元——而你大概率没盯着它。
去年帮一家做 To C 工具的朋友看账单。他跟我炫耀:"我们全量接了 Claude,体验飞起。"我让他把推理那张发票拉出来——一天九千多刀。他当场沉默。那还只是核心链路"一次"调用,不是全部。 下面这句是我越来越确信的判断:2026 年的 CTO,得把 token 成本当 QPS、当 P99 延迟一样去盯。它不是"云存储那种便宜到可以忽略"的账,它是一条会随产品规模悄悄爬升、直到啃掉利润曲线尾端的隐形成本。
先算一笔账
九千刀,是怎么来的
腾讯云一个被反复引用的案例:日活 50 万的 To C 产品,在核心链路嵌一次 Claude Sonnet 调用,单次 2000 输入 + 800 输出 token。我按 2026 年 9 月的公开定价把它摊开算——
模型(单价 $/1M) | 输入 | 输出 | 单次成本 | 日成本(50万次) |
|---|---|---|---|---|
DeepSeek V4 Flash | 0.14 | 0.28 | $0.0005 | $252 |
Claude Haiku 4.5 | 1.00 | 5.00 | $0.006 | $3,000 |
Claude Sonnet 4.6 | 3.00 | 15.00 | $0.018 | $9,000 |
GPT-5.6 Sol | 4.00 | 20.00 | $0.024 | $12,000 |
Claude Opus 4.8 | 5.00 | 25.00 | $0.030 | $15,000 |
GPT-5.5 | 5.00 | 30.00 | $0.034 | $17,000 |
(假设 50 万日活、每活跃用户每天触发 1 次核心调用;真实产品往往是 3 到 5 倍。)
同一行代码,换模型,日成本从 252 刀到 1.7 万刀——差了 67 倍。而大多数团队的默认动作,是"先上最强的,体验优先",等账单到了才肉疼。旗舰模型的输入单价是预算模型的 35 倍,输出单价更是 100 倍以上。这中间的落差,就是利润被吃掉的缝隙。
真正吓人的在后面
看不见的二次曲线
上面的账,还只是"一次调用"。可凡是带对话、带 Agent 的产品,调用是连成串的。而大模型有个反直觉的脾气:它没记忆,每一轮都要把整段历史重新发回去。第一轮的提问,在第二、第三……第五十轮被反复付钱。
有人把这条规律称做"二次曲线陷阱"。累计输入 token 约等于 B×N + g×N(N−1)/2,那个 N² 项才是主角。摊开算(固定前缀 2500 token,每轮新增约 400):
10 轮对话,累计输入约 4.3 万 token,成本 6 分钱;50 轮,累计输入 61.5 万,成本 6 毛 9——历史重发已经占了账单的 80%;100 轮,累计输入 223 万,成本 2 块 4。轮数翻 10 倍,成本翻了 40 倍。到 200 轮,真实对话大概 8 万 token,却被计费 846 万输入 token——你写的每个字,平均付了 100 遍。
还有个更扎心的实测:一个 14 token 的问题,第 1 轮处理成本 0.18 分,到第 260 轮同样的问题要 2.41 刀——涨了 1339 倍。而用户自己敲的字,只占被处理 token 的 1.3%,剩下 98.7% 是系统提示词和一遍遍重发的历史。也就是说,你以为在为一句话付费,其实在为一整座越堆越高的上下文付复利。
钱去哪了
80% 的浪费,藏在选择里
2026 年有个被低估的事实:企业 AI 总预算里,推理已经占到 85% 以上。而同一批数据又指出,生产流量里大概 80% 的请求,根本用不着旗舰模型——分类、抽取、格式化、简单问答,小模型就能办。
我自己的判断是,很多团队不是不会省,是压根没把"路由"当架构来 design。上来全量旗舰,等于用法拉利跑全员通勤。Gartner 甚至预测,到 2027 年企业用专用小模型会是通用大模型的三倍。这不是模型变弱了,是流量本来就该分层。
有家法律科技公司把我上面这套做了减法:小模型(7B、4 位量化)吃下 80% 请求,复杂case才升到 70B。结果平均推理成本降了 63%,用户满意度 99.2%。成本砍掉一大截,体验反而没掉——因为那 80% 本来就不是难活。
解法已经跑通
分层推理,不是 PPT 概念
把"路由"当成一等的架构组件,做法已经很成熟,三档就够:
第一档,本地小模型。高频、低复杂度的意图——意图识别、字段抽取、格式转换——本地跑,零数据出网,成本只剩电费。这部分通常能吃掉 80% 的流量。
第二档,私有云中模型。需要点领域知识、但不必"世界级推理"的活——标准合同起草、技术文档摘要——交给中档模型,隐私和成本折中。
第三档,旗舰。只有高难度推理、多步规划、创意综合才升级,而且通常先过一道脱敏。最难的那 5%–15% 流量落在这里。
再加两道保险:提示词缓存——Claude 的缓存读比标准输入便宜 90%(Sonnet 从 3 掉到 0.30 / 1M),对固定系统提示词和多轮固定前缀简直是白捡;上下文封顶——给活跃窗口设上限,旧历史要么摘要、要么外置到向量库按需取,别让它无限重发。光这两招,很多场景的账单就能砍掉一半以上。
写给 CTO 的落地清单
别等账单教你做人
1. 把 token 成本当一阶指标:每个请求埋"单次成本 + 日成本",进监控面板,设告警。 2. 上路由层:三档模型,80% 走小/便宜模型,别全量旗舰。 3. 开提示词缓存 + 给上下文封顶,堵住二次曲线的口子。 4. 看"单任务成本"而非"每 token 单价"——一次 agentic 任务可能烧掉上百刀。 5. 给 Agent 设步数和工具调用硬上限,防失控循环把预算烧穿。 你的利润表,从来不是被一次大支出打穿的,是被一行行 token 悄悄吃空的。把它亮出来,你才知道钱去哪了。