DeepSeek V4.1-Flash
前沿大模型的成本效率转向
DeepSeek 在 2026 年 9 月的技术报告中推出 V4.1-Flash:一款 5520 亿总参数的混合专家(MoE)模型,预填充阶段仅激活 8B、解码阶段激活 16B,原生支持 百万 token 上下文与多模态输入,并以 开源权重 发布。真正的看点不是又一个基准峰值,而是:一款开源模型如今在主流智能体编码上 追平了最强闭源模型,服务它所需的显存与算力却只有零头。本简报区分报告中已披露与仍属估算的内容,对其声明逐项对照基准,并指出前沿竞赛的争夺重心已悄然改变。
摘要
三个数字框定这次发布,而三类陈述必须分柜摆放:架构是什么、基准说明了什么、哪些仍是估算。
一段话主张
过去三年,前沿只由一个问题定义——峰值分数能有多高? V4.1-Flash 证明,如今第二条轴同等重要:每单位算力、显存与美元,能换来多少有用的、长程的、智能体式产出。这款模型几乎每个关键选择都服务于第二条轴:让预填充保持廉价的非对称 MoE、把预填充 FLOPs 约减半的因果编码-解码器、用 FP4 跨层共享 KV 以削平显存墙,以及让长上下文缓存得以近乎无损卸载到 SSD 的有界重放技巧。其结果是一款开源权重的 Flash 档模型,在企业真正上量的工作负载——自主软件工程——上与旗舰闭源模型竞争,而不是在某张考卷的天花板上争高下。
V4.1-Flash 究竟是什么
它不是上代的加密复刻,而是一套服务优先的架构。三个机制各司其职,分别攻克一种成本。
| 机制 | 是什么 | 攻克的成本 |
|---|---|---|
| CED——因果编码-解码器 | 40 层拆为 20 编码层 + 20 解码层;解码器的全局 KV 由编码器最后一层投影而来 | 预填充算力约减半,同时保留因果、兼容解码器的服务路径 |
| CSA2——压缩稀疏注意力 2 | 跨层共享 KV 与稀疏索引,含 Full / Reindex / Reuse 三种模式;主 KV 以 FP4 存放,配合分层稀疏索引器 | KV 缓存显存——全局 KV 降至约 890 字节/token,约为 V4-Flash 的四分之一 |
| SWA 有界重放 | 滑窗注意力的 KV 不写入持久缓存;近期窗口通过重放一段有界区间近似重建 | 卸载/持久化 KV 约 1/8,精度损失极小——长上下文缓存便宜到可放 SSD/主机内存 |
非对称正是信号所在。传统 MoE 在预填充与解码激活同样的专家;V4.1-Flash 却 预填充激活 8B、解码激活 16B——在自回归生成受瓶颈处投入参数,在受显存带宽主导的提示摄入处保持精瘦。再加上原生 1M 上下文与多模态输入,设计目标毫不含糊:高吞吐、长上下文、智能体密集的生产流量,而非演示用榜单。
真正关键的基准——以及一面不讨好它的镜子
我们更看重智能体式、长程的编码任务,而非一次性考卷分数,因为企业部署正朝此方向走。此处所有对手数字都是 DeepSeek 自己引用的。
智能体编码:V4.1-Flash 与它追赶的前沿
| 基准 | V4.1-Flash | V4-Pro(上代) | 解读 |
|---|---|---|---|
| DeepSWE v1.1 | 74.2 | — | 在自主 SWE 上追平/略超旗舰闭源模型 |
| Terminal-Bench 2.1 | 90.6 | — | 主流终端智能体任务上同级最佳 |
| Terminal-Bench 4.0 | 31.2 | — | 最难档位与 Opus 5(51.8)差距明显 |
| Codeforces 评分 | 3471 | 3348 | 竞赛编程相比 V4-Pro 实质性跃升 |
| HumanEval | 79.4 | — | 稳健但已饱和——前沿区分度低 |
| GSM8K | 93.0 | — | 全行业基本饱和,已非差异点 |
成本效率转向
为什么显存与 token 经济——而非参数量——正成为决定性变量,以及 V4.1-Flash 如何绕开它们做工程。
4.1 1M 上下文下,真正的对手是显存墙
在百万 token 上下文下,增长最凶的成本不是模型参数,而是 KV 缓存——随每个 token、每个并发用户增长的请求级显存。一个答题正确、却需要四到八倍 KV 显存的模型,根本无法以同等并发或价格提供服务。CSA2 加 FP4 把全局 KV 压到约 890 字节/token(约为 V4-Flash 的四分之一),有界重放则让持久层——卸载到 SSD 或主机内存的部分——缩到约 八分之一。这正是“1M 上下文只在 demo 里跑得动”与“1M 上下文对上千并发智能体也划算”之间的差别。
4.2 推理强度成为可调旋钮
该模型把推理强度做成 1–100 的连续刻度,而非几个固定档位。DeepSeek 称 60–80 区间能用约一半 token 拿到最高档位八成以上的增益。对采购者而言,这是一等成本杠杆:团队不必总是跑最深(也最贵)的推理链,而可让强度匹配任务难度,以一小部分边际花费拿到大部分质量。
4.3 每美元产出才是当下记分牌
把更便宜的预填充(CED)、更小的 KV(CSA2/重放)、稀疏激活(8B/16B)与可调推理旋钮合起来,关键指标就从峰值准确率转向 每美元服务成本产出的正确长程动作吞吐。在这块记分牌上,一款可自托管的开源模型,在高量负载中具有高定价闭源 API 结构性难以匹敌的优势——哪怕闭源模型在一张已饱和考卷上高一两分。
与前沿闭源模型正面对比
标价为我方榜单数据集中各厂商公开的每百万 token 费率;闭源模型参数/KV 数字未公开。“—”表示 V4.1 报告未在该基准上引用该模型。
| 模型 | DeepSWE v1.1 | TB 4.0 | 总参 / 激活 | 上下文 | 开源权重 | 标价 $ 入/出/百万 |
|---|---|---|---|---|---|---|
| DeepSeek V4.1-Flash | 74.2 | 31.2 | 552B / 8B–16B | 1M | 是 | ~0.14 / 0.28(估算) |
| Claude Opus 5 | 74.0 | 51.8 | 未公开 | 1M | 否 | 5.00 / 25.00 |
| GPT-5.6 Sol | 73.0 | — | 未公开 | 1.05M | 否 | 5.00 / 30.00 |
| Claude Fable 5.1 | — | — | 未公开 | 1M | 否 | 10.00 / 50.00 |
| GPT-6 Astra | — | — | 未公开 | 1.05M | 否 | 10.00 / 50.00 |
| Gemini 3.8 Flash | — | — | 未公开 | 1M | 否 | 0.75 / 3.75 |
在官方 model card 发布前,V4.1-Flash 托管价为沿用 V4-Flash 档位的估算;用开源权重自托管则产生 GPU/运维成本而非按 token 计费。闭源模型的参数与 KV 字节数未公开,按未公开呈现、不做估算。基准中的“—”=V4.1 报告未引用。
- 对旗舰闭源模型(输入 $5–10):DeepSWE 基本打平,标价低一个数量级且可开源部署——但在最难的 TB 4.0 档位明显落后。
- 对闭源“Flash”档(Gemini 3.8 Flash):这是同价位、同赛道的正面较量;V4.1-Flash 以开源权重与自托管应对,Gemini 则提供原生音视频与托管 SLA。这是整个 Q4 最值得盯的对位。
- 结构性不对称:每个闭源对手都把架构保密,因此它们自身的效率差距(若有)无法被独立审计;DeepSeek 公开了机制,这本身就是可信度与采购上的优势。
对采购者与开源的意义
把这次发布翻译成选型标准,而非追星。
什么时候首选 V4.1-Flash
- 1M 上下文下的 高量智能体编码与长程智能体,此时每 token 成本与 KV 显存经济主导总成本。
- 有 数据驻留 / 私有化部署 要求:开源权重让你能在自有 VPC 或本地机房运行,数据不出域。
- 吞吐敏感的服务:并发与首 token 延迟比一张饱和考卷上的一两分更重要,且 60–80 推理区间允许你调节单任务成本。
什么时候仍应为顶级闭源模型付费
- 最难的开放式科研智能体(TB 4.0 的差距是真实的),或需要原生音视频、托管级企业 SLA、SOC2 与厂商支持的负载。
- 当你不想自己运维 GPU:开源权重把成本从 API 费转移到基础设施与 MLOps;对量小、波动大或非专业的场景,托管 API 的总账仍可能更便宜。
结论与观察清单
理解 V4.1-Flash 的最佳方式,不是“DeepSeek 又登顶一张榜”,而是另一种竞争的证据点:一套透明、开源权重的设计,通过把服务效率——预填充 FLOPs、KV 显存、激活参数非对称、推理 token 经济——当作一等工程目标而非事后补丁,就能在企业上量的智能体负载上匹敌最强闭源系统。峰值能力之争仍在继续;如今它旁边多了一场部署效率之争,而在第二赛道上,开源阵营已取得明确领先。
观察清单(可证伪)
- 官方 model card 与定价:确认最终托管价与确切的 KV 字节/激活参数规格;在此之前我方数字带估算。
- 独立复现:第三方(以及我方复测)能否印证 DeepSWE 74.2、TB 2.1 90.6?TB 4.0 的差距会否在小版本中收窄?
- 闭源厂商反应:OpenAI、Anthropic、Google 会否公开各自的 KV 效率细节、或下调 Flash 档价格——也就是,它们会不会在新轴线上应战?
- 自托管的真实经济:在并发下以 1M 上下文部署 552B 权重时,实际 GPU 显存、吞吐与每 token 美元成本。
- 生态成熟度:围绕 CED/CSA2 栈的微调工具、推理内核与供应商支持——这是从一篇强论文到默认生产选型之间的闸门。
资料来源与方法
技术报告是架构与全部 V4.1-Flash 基准数字的一手来源;对手基准为其引用值;标价来自 Modelspectra 榜单数据集跟踪的公开厂商定价。访问于 2026-09-11。
| 来源 | 类型 | 用于 |
|---|---|---|
| DeepSeek-AI——V4.1 / V4.1-Flash 技术报告(2026.09) | 厂商一手 | 552B / 8B–16B 架构;CED、CSA2、有界重放;890 字节/token KV;DeepSWE、Terminal-Bench、HumanEval、GSM8K、Codeforces;推理强度旋钮 |
| DeepSWE v1.1 公开榜单 | 第三方基准 | 交叉核对 74.2 对 Opus 5(74.0)、GPT-5.6 Sol(73.0) |
| Terminal-Bench(2.1 / 4.0)公开结果 | 第三方基准 | 交叉核对 90.6 / 89.1,以及 31.2 对 51.8 的最难档差距 |
| 厂商公开定价页(Anthropic、OpenAI、Google) | 厂商定价 | 第 05 节对比表中每百万 token 的输入/输出标价 |
| Modelspectra 榜单数据集(收录 27 款模型) | 内部、有来源 | 对比模型的上下文、模态、授权与定位 |