把大模型当办公楼看,就懂 DeepSeek 为什么敢一直降价
9 月 10 日,DeepSeek 发布了新模型 V4.1 Flash。
发布当天还有一条少见的消息:自家上一代旗舰 V4 Pro,9 月 14 日起退役下线,所有请求全部转给这座新模型。
一个新模型,参数量是老旗舰的一半左右,价格更低,把自家最贵的模型挤下线,它靠什么?
这次不堆名词,用一栋 40 层的办公楼,把它的省钱的门道讲清楚。


一栋只开部分灯的楼



把大模型想成一栋 40 层的办公楼,模型的一层网络就是楼的一层。
全楼有 552B 个参数工位,但大部分工位平时是黑的:每来一个任务,只点亮一小部分。
这就是所谓的 MoE,专家混成,谁在岗谁干活,没被点名的专家不出工。
这栋楼跟老式模型最大的不同,是楼上楼下分工明确:1 到 20 层是阅读区,21 到 40 层是写作区。
你发给它的长文档(代码仓库、聊天记录、终端输出)完整走过 1 到 20 层,每层只开 8B 的工位灯。
轮到生成回答时,21 到 40 层每层开 16B 的灯。
写作比阅读费人,但写作的量比阅读小得多。
AI 干活的日常是读十页写一句:读文件、翻聊天记录、查终端报错,真正落笔的就几十个字。
老式模型是一栋 40 层楼既管读又管写:读一份文档,每层都得起全套人马伺候。
这栋楼把读写拆开,读的成本直接减半。
DeepSeek 给这套设计起的名字叫「因果编码器-解码器」,听着唬人,实际就是阅读区和写作区分层办公。
写作区 · 21-40 层每层亮 16B 灯第 20 层:交出「会议纪要」(全局 KV)阅读区 · 1-20 层每层亮 8B 灯输入输出读写长输入完整走过 1-20 层(8B);生成回答走 21-40 层(16B)· 数据:DeepSeek V4.1 技术报告


第20层交出会议纪要



省人的招讲完了,再看省档案室的招。
模型读过一篇长文档之后,需要把「读过的内容」存成笔记,后面写回答时要随时翻。
这套笔记在行业里叫 KV 缓存,是大模型成本里最咬手的一块:
上下文越长,笔记越厚,楼里的档案室(显存)和地下仓库(硬盘)越挤。
传统做法是每层楼都各自记一份全套笔记,40 层楼就是 40 份完整档案。
DeepSeek V4.1 Flash 的做法:读到第 20 层,把全部理解压缩成一份「会议纪要」,交给写作区。
21 到 40 层共用这份纪要干活,不再各自记笔记。
你看到的「长输入完整通过前 20 层、后 20 层基于第 20 层状态」,说的就是这件事。
纪要会不会丢信息?会有人担心。
但看成绩单:它在修软件 bug 的 DeepSWE 考试拿 74.2 分,超过自家上代旗舰的 62.7;在命令行实操的 Terminal-Bench 2.1 拿 90.6 分,排到前列。
纪要没耽误干活。
每个字的笔记:少了四分之三运行时全局 KV 缓存(字节/Token)上一代 V4 Flash≈3560 BV4.1 Flash890 B↓ 降到约 1/4持久存储(地下仓库常年占用)上一代100%V4.1 Flash≈1/8代价:翻旧账时重读最近几页重建,官方未公布极端恢复耗时数据:DeepSeek 官方发布 · 2026-09


三板斧压到八分之一



会议纪要只是第一刀。
往下还有三招,把存储一路压到底。
第一招,跨层共用(CSA2)。
写作区不是每层都建档案室:有的层存全套,有的层只存检索目录,有的层连目录都直接借楼上邻居的。
要用的时候按目录去找,不用每层都备一份。
第二招,速记符号(FP4)。
笔记不存逐字录音,只存速记,每个数字占的位数砍掉大半。
折算下来,每处理一个字,全局笔记只占 890 字节。
100 万字的上下文,笔记总共约 0.9 GB,一块 U 盘就装下。
第三招,旧账不进仓库(SWA Bounded Replay)。
最近几页笔记放抽屉里随手翻,更早的现场笔记干脆不存进地下仓库。
真要翻旧账,把最近几页重读一遍就能重建出来。
仓库常年占用直接降到上一代的八分之一。
三招合计:运行时档案降到上一代的约四分之一,持久存储降到约八分之一。
官方的说法是 HBM 需求 1/4、SSD 需求 1/8。跟初代模型比,缓存已经缩小了 437 倍。
短跑第一,马拉松落后Terminal-Bench 成绩(分数越高越好)90.689.1TB 2.130.043.3TB 3.031.251.8TB 4.0V4.1 FlashClaude Opus数据:DeepSeek 官方评测表 · 最大思考档 · 2026-09


成绩单的三个小字



74.2 和 90.6 这两个分数是真的,但都带着三个小字条件,引用之前得看全。
小字一:给足了思考时间。
官方所有成绩都是把「思考档位」拉到最大的 100 档跑出来的。
这个档位可以从 1 调到 100,档位越低越快越便宜,分数也跟着掉。限时考,分数不是这个数。
小字二:分数里含装备分。
同一个模型配不同的「考试脚手架」(外面套的自动化操作框架),成绩差得不少:DeepSWE 换 8 套脚手架,分差接近 9 分。
分数是「模型加装备」的联合成绩,不全是模型裸能力。
小字三:短跑第一,马拉松落后。Terminal-Bench 2.1 它拿 90.6 排第一,但更难的 3.0 版掉到 30.0、4.0 版只有 31.2,都被 Claude Opus 压着(43.3 和 51.8)。
任务越长越复杂,差距越明显。
「轻量任务能打」成立,「全面领先」不成立。
还有一条藏在合同里:翻旧账省仓库的前提是「要花重读的时间」。
缓存全丢、百万字文档冷启动这种极端情况要多花多少时间,官方没给数据。
省存储是真省,但不是白省。


和你有什么关系

直接用 DeepSeek API 跑自动化任务的,缓存命中价只有正常输入价的约 2%,长任务的账单会明显变薄。
不跑 API 的,这栋楼也是一个信号:行业的比法正在变。
过去比谁楼大,现在比谁会过日子。
旗舰按小模型的价格卖,省下的钱最后体现在你付的账单里。
下次看到厂商比参数,多问一句:点亮了多少灯,笔记存了多少,那才是决定价格的部分。
#DeepSeek #大模型 #AI成本 #人工智能#科技前沿
数据来源:DeepSeek V4.1 技术报告与官方发布(2026-09-10)· Terminal-Bench、DeepSWE 官方评测口径 · 分数为最大思考档+指定脚手架条件下的官方自报成绩
喜欢就点击关注我哦~