MModelspectra独立 AI 模型情报
前沿研究简报 · 2026.09.11
前沿研究简报 · 模型经济学

DeepSeek V4.1-Flash
前沿大模型的成本效率转向

DeepSeek 在 2026 年 9 月的技术报告中推出 V4.1-Flash:一款 5520 亿总参数的混合专家(MoE)模型,预填充阶段仅激活 8B、解码阶段激活 16B,原生支持 百万 token 上下文与多模态输入,并以 开源权重 发布。真正的看点不是又一个基准峰值,而是:一款开源模型如今在主流智能体编码上 追平了最强闭源模型,服务它所需的显存与算力却只有零头。本简报区分报告中已披露与仍属估算的内容,对其声明逐项对照基准,并指出前沿竞赛的争夺重心已悄然改变。

数据截至2026.09.11
主要来源DeepSeek V4.1 技术报告
阅读时长约 9 分钟
立场独立、不站队
01

摘要

三个数字框定这次发布,而三类陈述必须分柜摆放:架构是什么、基准说明了什么、哪些仍是估算。

模型规模 / 激活参数
552B
MoE 总参数;预填充激活 8B、解码激活 16B——刻意的非对称设计
全局 KV 缓存
~890 B/tok
全局 KV 每 token 字节数——约为 V4-Flash 的 1/4;持久化(卸载)KV 约 1/8
智能体编码
74.2
DeepSWE v1.1,对照 Claude Opus 5 74.0、GPT-5.6 Sol 73.0;开源权重、1M 上下文

一段话主张

过去三年,前沿只由一个问题定义——峰值分数能有多高? V4.1-Flash 证明,如今第二条轴同等重要:每单位算力、显存与美元,能换来多少有用的、长程的、智能体式产出。这款模型几乎每个关键选择都服务于第二条轴:让预填充保持廉价的非对称 MoE、把预填充 FLOPs 约减半的因果编码-解码器、用 FP4 跨层共享 KV 以削平显存墙,以及让长上下文缓存得以近乎无损卸载到 SSD 的有界重放技巧。其结果是一款开源权重的 Flash 档模型,在企业真正上量的工作负载——自主软件工程——上与旗舰闭源模型竞争,而不是在某张考卷的天花板上争高下。

全文披露纪律:下文架构与基准数字均来自 DeepSeek 技术报告。托管标价与少数服务规格在报告中并未定稿;我们沿用 V4-Flash 档位的估算并标注为估算。闭源对手(GPT-6 Astra、Claude 与 Gemini 系列)的参数量与 KV 数字通常未公开,一律如实标注而非猜测。
02

V4.1-Flash 究竟是什么

它不是上代的加密复刻,而是一套服务优先的架构。三个机制各司其职,分别攻克一种成本。

机制是什么攻克的成本
CED——因果编码-解码器40 层拆为 20 编码层 + 20 解码层;解码器的全局 KV 由编码器最后一层投影而来预填充算力约减半,同时保留因果、兼容解码器的服务路径
CSA2——压缩稀疏注意力 2跨层共享 KV 与稀疏索引,含 Full / Reindex / Reuse 三种模式;主 KV 以 FP4 存放,配合分层稀疏索引器KV 缓存显存——全局 KV 降至约 890 字节/token,约为 V4-Flash 的四分之一
SWA 有界重放滑窗注意力的 KV 不写入持久缓存;近期窗口通过重放一段有界区间近似重建卸载/持久化 KV 约 1/8,精度损失极小——长上下文缓存便宜到可放 SSD/主机内存

非对称正是信号所在。传统 MoE 在预填充与解码激活同样的专家;V4.1-Flash 却 预填充激活 8B、解码激活 16B——在自回归生成受瓶颈处投入参数,在受显存带宽主导的提示摄入处保持精瘦。再加上原生 1M 上下文与多模态输入,设计目标毫不含糊:高吞吐、长上下文、智能体密集的生产流量,而非演示用榜单。

03

真正关键的基准——以及一面不讨好它的镜子

我们更看重智能体式、长程的编码任务,而非一次性考卷分数,因为企业部署正朝此方向走。此处所有对手数字都是 DeepSeek 自己引用的。

智能体编码:V4.1-Flash 与它追赶的前沿

越高越好;条形共用 0–100 量纲。来源:DeepSeek V4.1 技术报告(DeepSWE v1.1;Terminal-Bench 2.1 / 4.0)。
DeepSWE v1.1——自主软件工程
DeepSeek V4.1-Flash
74.2
Claude Opus 5
74.0
GPT-5.6 Sol
73.0
Terminal-Bench 2.1——终端智能体任务
DeepSeek V4.1-Flash
90.6
Claude Opus 5
89.1
Terminal-Bench 4.0——最难的科研智能体
Claude Opus 5
51.8
DeepSeek V4.1-Flash
31.2
基准V4.1-FlashV4-Pro(上代)解读
DeepSWE v1.174.2在自主 SWE 上追平/略超旗舰闭源模型
Terminal-Bench 2.190.6主流终端智能体任务上同级最佳
Terminal-Bench 4.031.2最难档位与 Opus 5(51.8)差距明显
Codeforces 评分34713348竞赛编程相比 V4-Pro 实质性跃升
HumanEval79.4稳健但已饱和——前沿区分度低
GSM8K93.0全行业基本饱和,已非差异点
诚实解读:V4.1-Flash 在贡献大部分生产价值的主流智能体负载上追平前沿,但 Terminal-Bench 4.0 表明,最难的开放式科研智能体天花板仍属于顶级闭源模型。“追平前沿”对八成场景成立,却不等于整体对等。
04

成本效率转向

为什么显存与 token 经济——而非参数量——正成为决定性变量,以及 V4.1-Flash 如何绕开它们做工程。

4.1 1M 上下文下,真正的对手是显存墙

在百万 token 上下文下,增长最凶的成本不是模型参数,而是 KV 缓存——随每个 token、每个并发用户增长的请求级显存。一个答题正确、却需要四到八倍 KV 显存的模型,根本无法以同等并发或价格提供服务。CSA2 加 FP4 把全局 KV 压到约 890 字节/token(约为 V4-Flash 的四分之一),有界重放则让持久层——卸载到 SSD 或主机内存的部分——缩到约 八分之一。这正是“1M 上下文只在 demo 里跑得动”与“1M 上下文对上千并发智能体也划算”之间的差别。

4.2 推理强度成为可调旋钮

该模型把推理强度做成 1–100 的连续刻度,而非几个固定档位。DeepSeek 称 60–80 区间能用约一半 token 拿到最高档位八成以上的增益。对采购者而言,这是一等成本杠杆:团队不必总是跑最深(也最贵)的推理链,而可让强度匹配任务难度,以一小部分边际花费拿到大部分质量。

4.3 每美元产出才是当下记分牌

把更便宜的预填充(CED)、更小的 KV(CSA2/重放)、稀疏激活(8B/16B)与可调推理旋钮合起来,关键指标就从峰值准确率转向 每美元服务成本产出的正确长程动作吞吐。在这块记分牌上,一款可自托管的开源模型,在高量负载中具有高定价闭源 API 结构性难以匹敌的优势——哪怕闭源模型在一张已饱和考卷上高一两分。

前沿并未停止追逐峰值能力。但峰值能力不再是市场奖励的唯一轴线——而 V4.1-Flash 是迄今最清楚的证据:部署效率这条轴,可以在开源世界里被直接攻克。
05

与前沿闭源模型正面对比

标价为我方榜单数据集中各厂商公开的每百万 token 费率;闭源模型参数/KV 数字未公开。“—”表示 V4.1 报告未在该基准上引用该模型。

模型DeepSWE v1.1TB 4.0总参 / 激活上下文开源权重标价 $ 入/出/百万
DeepSeek V4.1-Flash74.231.2552B / 8B–16B1M~0.14 / 0.28(估算)
Claude Opus 574.051.8未公开1M5.00 / 25.00
GPT-5.6 Sol73.0未公开1.05M5.00 / 30.00
Claude Fable 5.1未公开1M10.00 / 50.00
GPT-6 Astra未公开1.05M10.00 / 50.00
Gemini 3.8 Flash未公开1M0.75 / 3.75

在官方 model card 发布前,V4.1-Flash 托管价为沿用 V4-Flash 档位的估算;用开源权重自托管则产生 GPU/运维成本而非按 token 计费。闭源模型的参数与 KV 字节数未公开,按未公开呈现、不做估算。基准中的“—”=V4.1 报告未引用。

  • 对旗舰闭源模型(输入 $5–10):DeepSWE 基本打平,标价低一个数量级且可开源部署——但在最难的 TB 4.0 档位明显落后。
  • 对闭源“Flash”档(Gemini 3.8 Flash):这是同价位、同赛道的正面较量;V4.1-Flash 以开源权重与自托管应对,Gemini 则提供原生音视频与托管 SLA。这是整个 Q4 最值得盯的对位。
  • 结构性不对称:每个闭源对手都把架构保密,因此它们自身的效率差距(若有)无法被独立审计;DeepSeek 公开了机制,这本身就是可信度与采购上的优势。
06

对采购者与开源的意义

把这次发布翻译成选型标准,而非追星。

什么时候首选 V4.1-Flash

  • 1M 上下文下的 高量智能体编码与长程智能体,此时每 token 成本与 KV 显存经济主导总成本。
  • 数据驻留 / 私有化部署 要求:开源权重让你能在自有 VPC 或本地机房运行,数据不出域。
  • 吞吐敏感的服务:并发与首 token 延迟比一张饱和考卷上的一两分更重要,且 60–80 推理区间允许你调节单任务成本。

什么时候仍应为顶级闭源模型付费

  • 最难的开放式科研智能体(TB 4.0 的差距是真实的),或需要原生音视频、托管级企业 SLA、SOC2 与厂商支持的负载。
  • 当你不想自己运维 GPU:开源权重把成本从 API 费转移到基础设施与 MLOps;对量小、波动大或非专业的场景,托管 API 的总账仍可能更便宜。
对开源运动而言,这是在核心生产场景里的一次抢滩。早期开源模型在闲聊与简单任务上以价格取胜,而严肃的智能体工程由闭源把持。V4.1-Flash 跨入了本应是闭源护城河的工作负载——自主、多文件、长上下文的软件智能体。它没有抹平最顶端的护城河,却把开源/闭源的分界线坚决地向上推了一格。
07

结论与观察清单

理解 V4.1-Flash 的最佳方式,不是“DeepSeek 又登顶一张榜”,而是另一种竞争的证据点:一套透明、开源权重的设计,通过把服务效率——预填充 FLOPs、KV 显存、激活参数非对称、推理 token 经济——当作一等工程目标而非事后补丁,就能在企业上量的智能体负载上匹敌最强闭源系统。峰值能力之争仍在继续;如今它旁边多了一场部署效率之争,而在第二赛道上,开源阵营已取得明确领先。

观察清单(可证伪)

  • 官方 model card 与定价:确认最终托管价与确切的 KV 字节/激活参数规格;在此之前我方数字带估算。
  • 独立复现:第三方(以及我方复测)能否印证 DeepSWE 74.2、TB 2.1 90.6?TB 4.0 的差距会否在小版本中收窄?
  • 闭源厂商反应:OpenAI、Anthropic、Google 会否公开各自的 KV 效率细节、或下调 Flash 档价格——也就是,它们会不会在新轴线上应战?
  • 自托管的真实经济:在并发下以 1M 上下文部署 552B 权重时,实际 GPU 显存、吞吐与每 token 美元成本。
  • 生态成熟度:围绕 CED/CSA2 栈的微调工具、推理内核与供应商支持——这是从一篇强论文到默认生产选型之间的闸门。
证伪条件:若独立复测显著低于所报智能体分数,若约 1/4、约 1/8 的 KV 压缩在真实并发负载下不成立,或最终定价远高于 V4-Flash 档位,则“成本效率领先”的结论相应削弱,我方榜单分数也会修订。
附录

资料来源与方法

技术报告是架构与全部 V4.1-Flash 基准数字的一手来源;对手基准为其引用值;标价来自 Modelspectra 榜单数据集跟踪的公开厂商定价。访问于 2026-09-11。

来源类型用于
DeepSeek-AI——V4.1 / V4.1-Flash 技术报告(2026.09)厂商一手552B / 8B–16B 架构;CED、CSA2、有界重放;890 字节/token KV;DeepSWE、Terminal-Bench、HumanEval、GSM8K、Codeforces;推理强度旋钮
DeepSWE v1.1 公开榜单第三方基准交叉核对 74.2 对 Opus 5(74.0)、GPT-5.6 Sol(73.0)
Terminal-Bench(2.1 / 4.0)公开结果第三方基准交叉核对 90.6 / 89.1,以及 31.2 对 51.8 的最难档差距
厂商公开定价页(Anthropic、OpenAI、Google)厂商定价第 05 节对比表中每百万 token 的输入/输出标价
Modelspectra 榜单数据集(收录 27 款模型)内部、有来源对比模型的上下文、模态、授权与定位