
2023年3月,GPT-4发布,API定价每百万Token输出$1.10。性能?几乎打平。价格?差了55倍。训练成本?GPT-4花了超过1亿美元,DeepSeek-V3花了560万美元。差了18倍。
如果这还不够震撼,看看最新的LMArena排行榜:
前5名模型的Elo分差不到25分——在95%置信区间内,它们统计上无法区分。
"谁更聪明"这个问题,在2026年已经没有意义了。
新的问题是:谁更便宜、谁更快、谁更适合我的场景。
今天这篇文章,把大模型从"参数军备竞赛"到"成本效益竞赛"的范式转移讲透。
LMArena(前身Chatbot Arena)是目前最权威的大模型实力排行榜,基于真人盲测投票打分。看看2026年中的排名:
排名 | 模型 | Elo(文本) | 厂商 |
|---|---|---|---|
1 | Claude Opus 4.6 | 1418 | Anthropic |
2 | Gemini 3.1 Pro | 1406 | |
3 | GPT-5.2 | 1402 | OpenAI |
4 | Claude Sonnet 4.6 | ~1395 | Anthropic |
5 | DeepSeek-V3.2 | ~1390 | DeepSeek |
第1名到第5名的差距:大约28分。
这是什么概念?在Elo评分体系中,两个选手分差25分以内意味着胜率接近54:46——也就是说,打100盘棋,领先者只多赢8盘。
用人话说:你让这5个模型做同一道题,差不多5次有3次答案一样。 差异小到用户体感几乎无法分辨。
更有意思的是开源模型和闭源模型的差距变化:
时间 | 开源vs闭源Elo差距 | 代表开源模型 |
|---|---|---|
2024年初 | 100-150分 | Llama 2, Mixtral |
2025年2月 | 4分(历史最低) | DeepSeek-V3 |
2026年中 | 25-55分 | Qwen3.5, DeepSeek-V3.2, Kimi K2.6 |
2025年2月,开源模型和闭源模型的差距一度缩小到仅4分。虽然后来闭源模型通过推理能力拉开了一些差距,但趋势非常明确:开源正在无限逼近闭源的天花板。
传统基准测试已经失去了区分度:
基准测试 | 当前头部模型得分 | 状态 |
|---|---|---|
MMLU | 88-94% | 饱和,无法区分 |
MMLU-Pro | ~90% | 接近饱和,前5名挤在6分带内 |
MATH-500 | 97%+ | 几乎满分 |
HumanEval | 95%+ | 饱和 |
现在能拉开差距的只剩下几个"变态级"测试:
新基准 | 最佳AI得分 | 人类专家得分 | 差距 |
|---|---|---|---|
Humanity's Last Exam | 41% | ~90% | 49分 |
ARC-AGI-2 | 低 | 高 | 巨大 |
SWE-Bench Pro | 58.6%(Kimi K2.6) | — | 仍有提升空间 |
老周的观点:模型趋同不是"AI停滞"的信号,而是"基础能力已经够用"的信号。 就像2010年以后,CPU单核性能增长放缓了,但我们并没有觉得电脑变慢了——因为瓶颈已经不在CPU上了。

GPT-3.5级别的能力,API价格变化:
时间 | 模型 | 输出价格($/百万Token) | 相对GPT-3.5 |
|---|---|---|---|
2022.11 | GPT-3.5 | $20.00 | 1x |
2023.03 | GPT-4 | $60.00 | 更贵了 |
2023.11 | GPT-4 Turbo | $30.00 | -50% |
2024.05 | GPT-4o | $15.00 | -75% |
2024.07 | GPT-4o-mini | $0.60 | -97% |
2024.12 | DeepSeek-V3 | $1.10 | -94.5% |
2025-2026 | Gemini Flash Lite | $0.40 | -98% |
2025-2026 | DeepSeek V3.2 Flash | $0.28 | -98.6% |
如果你觉得美国市场的降价已经很疯了,看看中国:
用人话说:美国的大模型API从"五星级酒店"降到了"快捷酒店",中国直接降到了"青年旅社"。
有一个重要的反面观点:
Google最近在涨价。Gemini 2.5 Flash输入价0.3,Gemini 3.5 Flash是1.5
——5倍。
有分析师指出:
"那些让你觉得产品可行的低价,从来不是实验室的真实定价。它们是风投补贴的获客折扣,现在正在被收回。"
老周的判断:短期降价趋势不可逆,但"race to zero"不可能真的到零。 最终会形成一个分层定价体系——就像云计算从"按需付费"演化出了Reserved Instance、Spot Instance、Savings Plan一样。
MoE(Mixture of Experts,混合专家)是当前最重要的模型架构创新。
一句话解释: 模型有很多"专家"(子网络),但每次只激活其中几个,其他的"休息"。
传统Transformer:每个Token过所有参数。 MoE Transformer:每个Token只过一小部分参数。
1 传统模型(Dense):
2 Token → [所有671B参数] → 输出
3 速度:慢 成本:高 知识:671B
4
5 MoE模型:
6 Token → 路由器 → [选择8个专家,共37B参数] → 输出
7 速度:快 成本:低 知识:671B(全部专家的总知识量)关键洞察:总参数量决定"知识容量",激活参数量决定"计算成本"。 MoE让你用小模型的成本,获得大模型的知识。
模型 | 总参数 | 激活参数 | 专家数 | 每Token激活 | 训练成本 |
|---|---|---|---|---|---|
Mixtral 8x7B | 46.7B | 12.9B | 8 | 2 | — |
DeepSeek-V3 | 671B | 37B | 256 | 8 | $560万 |
Qwen3-235B | 235B | 22B | 128 | 8 | — |
Llama 4 Maverick | 400B | 17B | — | — | — |
Llama 4 Behemoth | 2T | 288B | — | — | — |
Kimi K2 | 1T | 32B | 384 | 8+1共享 | — |
GLM-5 | 744B | MoE | — | — | — |
DeepSeek-V3的数据最能说明问题:671B的知识量,37B的计算成本。 推理速度由激活参数决定(37B),而不是总参数(671B)。这意味着它的推理速度接近一个37B的Dense模型,但知识储备是671B级别的。
DeepSeek-V3的训练报告公开了令人震惊的数据:
指标 | 数值 |
|---|---|
GPU型号 | NVIDIA H800(H100的出口管制版) |
GPU小时数 | 2,788,000小时 |
训练数据量 | 14.8万亿Token |
估算训练成本 | $5,576,000(约560万美元) |
对比一下:
模型 | 训练成本 | 硬件 |
|---|---|---|
GPT-4 | $1亿+(Altman亲口确认) | 25,000张A100,约100天 |
Llama 3.1 405B | 约$5亿 | 16,000张H100 |
DeepSeek-V3 | $560万 | H800 |
GPT-4是DeepSeek-V3训练成本的18倍。Llama 3.1是90倍。
而DeepSeek-V3的性能?跟GPT-4基本持平。
这就是为什么DeepSeek被称为AI行业的"Sputnik Moment"——它证明了:不是谁钱多谁就能赢,算法创新可以打败暴力堆算力。
DeepSeek-V3为什么能这么便宜?三个关键技术:
技术 | 作用 |
|---|---|
Multi-head Latent Attention (MLA) | 压缩KV缓存,减少显存占用 |
无辅助损失的负载均衡 | 让专家被均匀利用,不需要额外的正则化损失 |
Multi-Token Prediction | 一次预测多个Token,提高训练效率 |
用老周的话说:DeepSeek不是在更便宜的硬件上做了同样的事,而是发明了更聪明的训练方法。 这就像F1赛车——不是只靠引擎马力大,还要靠空气动力学设计。
模型 | 公司 | 总参数 | 亮点 | 许可证 |
|---|---|---|---|---|
DeepSeek-V3/R1 | DeepSeek | 671B | 性价比之王,Nature封面 | MIT |
Qwen3.5 | 阿里 | 397B/17B | HuggingFace下载量第一,201种语言 | Apache 2.0 |
Kimi K2.6 | 月之暗面 | 1T/32B | SWE-Bench Pro第一,300子Agent协同 | MIT(修改版) |
GLM-5 | 智谱AI | 744B | 港交所上市第一家AI公司 | MIT |
Seed 2.0 | 字节跳动 | — | 驱动豆包App,1.55亿周活 | 开源 |
一组数据让人侧目:
Qwen3-235B的技术参数:
数据点 | 数值 |
|---|---|
创始人 | 梁文锋(High-Flyer量化基金联合创始人) |
员工数 | 约200人 |
成立时间 | 2023年7月 |
首轮外部融资 | 2026年5月,估值73.5亿 |
投资方 | 国家AI产业投资基金(国家级$88亿基金) |
200人的团队,做出了跟数千人团队水平相当的模型。 梁文锋之前是量化交易出身,High-Flyer管理的资产规模让他可以自掏腰包买GPU,不需要外部融资。直到2026年5月才进行第一轮外部融资,估值直接到了$450-500亿。
HuggingFace的下载数据揭示了一个大趋势:
用人话说:开源模型的重心正在向中国倾斜。
维度 | 闭源旗舰 | 开源模型 | 差距 |
|---|---|---|---|
平均API价格 | $1.86/百万Token | $0.23/百万Token | 8倍 |
训练成本 | $1亿+ | $560万 | 18倍 |
推理成本(自部署) | 不可自部署 | 可自部署,高量级更省 | 视规模而定 |
一个有意思的数据:80%的用户选择闭源模型,尽管它们贵了87%。
为什么?
场景 | 推荐 | 原因 |
|---|---|---|
日Token量 < 50M | 闭源API | 自部署TCO更高 |
日Token量 > 100M | 开源自部署 | 年省5000万 |
数据敏感(金融/医疗) | 开源自部署 | 数据不出域 |
需要最新能力 | 闭源API | 开源滞后3-6个月 |
需要定制微调 | 开源 | 闭源不开放权重 |
预算有限 | 开源 + 托管API | Together.ai/Fireworks,1/3-1/10闭源价格 |
Deloitte 2026报告显示:最成功的企业采用分层模型策略:
1 80%的请求 → 便宜模型(Haiku/Flash/开源7B) 成本:极低
2 15%的请求 → 中档模型(Sonnet/Pro/开源70B) 成本:中等
3 5%的请求 → 旗舰模型(Opus/GPT-5/o3) 成本:高关键洞察:大多数请求根本不需要旗舰模型。 一个写得好的路由层,可以把总成本降低60-80%。
模型价格下降只是一半的故事。另一半是:推理效率也在指数级提升。
技术 | 效果 | 原理 |
|---|---|---|
量化(Quantization) | 内存减少2-4x | FP16→INT4,精度损失极小 |
蒸馏(Distillation) | 小模型替代80-90%大模型请求 | 大模型教小模型 |
投机解码(Speculative Decoding) | 吞吐提升2-3x | 小模型草拟,大模型一次验证 |
连续批处理(Continuous Batching) | 推理效率提升5x | vLLM/TensorRT-LLM |
组合使用这些技术,可以将推理成本降低60-80%,能耗降低73%。
DeepSeek R1的蒸馏版本(Distill-Qwen-32B)在多个基准上超越了OpenAI o1-mini。
你没看错:一个32B的蒸馏模型,干掉了OpenAI的闭源推理模型。
这就是蒸馏的威力——大模型的"智慧"可以被压缩进小模型里。
1 你的场景需要什么?
2 ├── 最强推理能力 → Claude Opus / o3(贵但强)
3 ├── 性价比最优 → DeepSeek R1(o1能力的3.6%价格)
4 ├── 高量级推理 → Qwen3-235B 自部署(开源+MoE)
5 ├── 简单任务/分类 → Haiku / Flash Lite / 开源7B
6 ├── 数据不能出域 → 开源模型自部署
7 └── 不确定 → 先用API试,跑出数据再决策第一步:分层路由 用一个简单的分类器,把请求按复杂度分到不同模型。80%的请求用便宜模型处理。
第二步:缓存策略 DeepSeek R1的缓存命中价格只有$0.14/M tokens(正常价的25%)。相同的System Prompt不要重复付费。
第三步:批处理 OpenAI Batch API和Anthropic Message Batches都提供50%折扣。不急的任务攒起来一起跑。
第四步:自部署评估 日均Token量超过1亿时,认真评估开源模型自部署。长期ROI可能是API的10倍以上。
2026年的AI行业,正在经历一场从"谁更聪明"到"谁更高效"的范式转移。
回想2023年,大家都在比"参数谁多"、"训练谁烧钱多"、"基准谁高"。到了2026年,前5名模型的Elo分差压缩到25分以内,MMLU饱和在90%附近,API价格3年暴跌280倍。
"军备竞赛"结束了,"效率竞赛"开始了。
DeepSeek用200人的团队、560万美元的训练成本,证明了算法创新可以打败暴力堆算力。Qwen用36万亿Token的预训练和Apache 2.0许可证,在HuggingFace上超越了Llama成为下载量第一。MoE架构让1万亿参数的模型只需要32B的计算成本就能跑起来。
这对架构师意味着什么?
意味着你选模型的维度变了。以前是"选最强的",现在是"选最合适的"。一个写得好的路由层+分层模型策略,可以把AI成本降低80%,而用户体验几乎不变。
一句话总结:AI的"摩尔定律"不在参数上,而在每美元的智能产出上。2026年,同样1美元能买到的AI能力,是2023年的280倍。
我是老周,一个在架构领域摸爬滚打多年的技术人。如果这篇文章对你有帮助,欢迎点赞、在看、转发三连。关注「老周聊架构」,每周深度解读AI和架构的最新趋势。