首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >把大模型当办公楼看,就懂 DeepSeek 为什么敢一直降价

把大模型当办公楼看,就懂 DeepSeek 为什么敢一直降价

作者头像
用户12724357
发布2026-09-15 19:18:23
发布2026-09-15 19:18:23
870
举报

把大模型当办公楼看,就懂 DeepSeek 为什么敢一直降价

9 月 10 日,DeepSeek 发布了新模型 V4.1 Flash。

发布当天还有一条少见的消息:自家上一代旗舰 V4 Pro,9 月 14 日起退役下线,所有请求全部转给这座新模型。

一个新模型,参数量是老旗舰的一半左右,价格更低,把自家最贵的模型挤下线,它靠什么?

这次不堆名词,用一栋 40 层的办公楼,把它的省钱的门道讲清楚。

一栋只开部分灯的楼

把大模型想成一栋 40 层的办公楼,模型的一层网络就是楼的一层。

全楼有 552B 个参数工位,但大部分工位平时是黑的:每来一个任务,只点亮一小部分。

这就是所谓的 MoE,专家混成,谁在岗谁干活,没被点名的专家不出工。

这栋楼跟老式模型最大的不同,是楼上楼下分工明确:1 到 20 层是阅读区,21 到 40 层是写作区

你发给它的长文档(代码仓库、聊天记录、终端输出)完整走过 1 到 20 层,每层只开 8B 的工位灯。

轮到生成回答时,21 到 40 层每层开 16B 的灯。

写作比阅读费人,但写作的量比阅读小得多。

AI 干活的日常是读十页写一句:读文件、翻聊天记录、查终端报错,真正落笔的就几十个字。

老式模型是一栋 40 层楼既管读又管写:读一份文档,每层都得起全套人马伺候。

这栋楼把读写拆开,读的成本直接减半

DeepSeek 给这套设计起的名字叫「因果编码器-解码器」,听着唬人,实际就是阅读区和写作区分层办公。

写作区 · 21-40 层每层亮 16B 灯第 20 层:交出「会议纪要」(全局 KV)阅读区 · 1-20 层每层亮 8B 灯输入输出读写长输入完整走过 1-20 层(8B);生成回答走 21-40 层(16B)· 数据:DeepSeek V4.1 技术报告

第20层交出会议纪要

省人的招讲完了,再看省档案室的招。

模型读过一篇长文档之后,需要把「读过的内容」存成笔记,后面写回答时要随时翻。

这套笔记在行业里叫 KV 缓存,是大模型成本里最咬手的一块:

上下文越长,笔记越厚,楼里的档案室(显存)和地下仓库(硬盘)越挤。

传统做法是每层楼都各自记一份全套笔记,40 层楼就是 40 份完整档案。

DeepSeek V4.1 Flash 的做法:读到第 20 层,把全部理解压缩成一份「会议纪要」,交给写作区。

21 到 40 层共用这份纪要干活,不再各自记笔记。

你看到的「长输入完整通过前 20 层、后 20 层基于第 20 层状态」,说的就是这件事。

纪要会不会丢信息?会有人担心。

但看成绩单:它在修软件 bug 的 DeepSWE 考试拿 74.2 分,超过自家上代旗舰的 62.7;在命令行实操的 Terminal-Bench 2.1 拿 90.6 分,排到前列。

纪要没耽误干活。

每个字的笔记:少了四分之三运行时全局 KV 缓存(字节/Token)上一代 V4 Flash≈3560 BV4.1 Flash890 B↓ 降到约 1/4持久存储(地下仓库常年占用)上一代100%V4.1 Flash≈1/8代价:翻旧账时重读最近几页重建,官方未公布极端恢复耗时数据:DeepSeek 官方发布 · 2026-09

三板斧压到八分之一

会议纪要只是第一刀。

往下还有三招,把存储一路压到底。

第一招,跨层共用(CSA2)。

写作区不是每层都建档案室:有的层存全套,有的层只存检索目录,有的层连目录都直接借楼上邻居的。

要用的时候按目录去找,不用每层都备一份。

第二招,速记符号(FP4)。

笔记不存逐字录音,只存速记,每个数字占的位数砍掉大半。

折算下来,每处理一个字,全局笔记只占 890 字节。

100 万字的上下文,笔记总共约 0.9 GB,一块 U 盘就装下。

第三招,旧账不进仓库(SWA Bounded Replay)。

最近几页笔记放抽屉里随手翻,更早的现场笔记干脆不存进地下仓库。

真要翻旧账,把最近几页重读一遍就能重建出来。

仓库常年占用直接降到上一代的八分之一。

三招合计:运行时档案降到上一代的约四分之一,持久存储降到约八分之一。

官方的说法是 HBM 需求 1/4、SSD 需求 1/8。跟初代模型比,缓存已经缩小了 437 倍。

短跑第一,马拉松落后Terminal-Bench 成绩(分数越高越好)90.689.1TB 2.130.043.3TB 3.031.251.8TB 4.0V4.1 FlashClaude Opus数据:DeepSeek 官方评测表 · 最大思考档 · 2026-09

成绩单的三个小字

74.2 和 90.6 这两个分数是真的,但都带着三个小字条件,引用之前得看全。

小字一:给足了思考时间。

官方所有成绩都是把「思考档位」拉到最大的 100 档跑出来的。

这个档位可以从 1 调到 100,档位越低越快越便宜,分数也跟着掉。限时考,分数不是这个数。

小字二:分数里含装备分。

同一个模型配不同的「考试脚手架」(外面套的自动化操作框架),成绩差得不少:DeepSWE 换 8 套脚手架,分差接近 9 分。

分数是「模型加装备」的联合成绩,不全是模型裸能力。

小字三:短跑第一,马拉松落后。Terminal-Bench 2.1 它拿 90.6 排第一,但更难的 3.0 版掉到 30.0、4.0 版只有 31.2,都被 Claude Opus 压着(43.3 和 51.8)。

任务越长越复杂,差距越明显。

「轻量任务能打」成立,「全面领先」不成立。

还有一条藏在合同里:翻旧账省仓库的前提是「要花重读的时间」。

缓存全丢、百万字文档冷启动这种极端情况要多花多少时间,官方没给数据。

省存储是真省,但不是白省。

和你有什么关系

直接用 DeepSeek API 跑自动化任务的,缓存命中价只有正常输入价的约 2%,长任务的账单会明显变薄。

不跑 API 的,这栋楼也是一个信号:行业的比法正在变。

过去比谁楼大,现在比谁会过日子。

旗舰按小模型的价格卖,省下的钱最后体现在你付的账单里。

下次看到厂商比参数,多问一句:点亮了多少灯,笔记存了多少,那才是决定价格的部分。

#DeepSeek #大模型 #AI成本 #人工智能#科技前沿

数据来源:DeepSeek V4.1 技术报告与官方发布(2026-09-10)· Terminal-Bench、DeepSWE 官方评测口径 · 分数为最大思考档+指定脚手架条件下的官方自报成绩

喜欢就点击关注我哦~

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-09-14,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档