先读懂 DeepSeek V4.1 Flash 的 KV 缓存数字。
DeepSeek V4.1 Flash 是 DeepSeek 当前的模型,它的技术报告围绕一个数字展开:每个 token 需要多少全局 KV 缓存。890 字节约为 V4-Flash 的四分之一、初代 DeepSeek 的 437 分之一——正是这个数字让百万 token 的智能体负载变得可负担。
本页的规格、评测与架构说明均来自 DeepSeek 自己的 V4.1 Flash 模型卡与技术报告。权重以 MIT 许可发布,但模型卡没有公布按 token 计费的价格。
DeepSeek 为 V4.1 Flash 公布的两张图
模型卡带了两张图:一张智能体评测对比,一张是 KV 缓存跨四代模型的下降曲线。DeepSeek 其它页面都用 JavaScript 绘制数字,所以这是官方仅有的静态图。
两张图版权归 DeepSeek 所有,转载时已署名: DeepSeek V4.1 Flash 模型卡
DeepSeek 如何描述 V4.1 Flash
DeepSeek 给技术报告的标题是「Pushing the Limits of KV Cache Compression」,数字也支撑这个标题。这是一款靠长上下文的持有成本取胜的模型,而不是靠拿下每一个榜单。
卖点是显存,不是单纯的分数
每 token 全局 KV 缓存 890 字节,约为 V4-Flash 3,514 字节的四分之一,比 V1 的 389,120 字节小 437 倍。对以长上下文服务、输入极重的智能体负载来说,这是一台机器与一整个机柜的差别。
编码器-解码器共用一个缓存
V4.1 Flash 采用 40 层的 Causal Encoder-Decoder:20 层编码器接 20 层解码器,解码器的全局 KV 缓存由编码器最终隐状态投影而来,而不是逐层自行推导。DeepSeek 表示这正是 prefill 阶段每 token 只激活 8B、decode 阶段激活 16B 的原因。
三种静态模式的稀疏注意力
Compressed Sparse Attention 2 给每个注意力层指定 Full、Reindex 或 Reuse 三种模式之一,从而在层间共享主 KV 与索引器 K,并复用 Top-K 稀疏索引。解码器中还有分层稀疏索引器,把更深层索引的开销限制在与上下文长度无关的水平;FP4 主 KV 缓存则每 16 个通道存一个 E4M3 缩放。
预训练阶段就原生多模态
从头训练的 DeepSeek-ViT 编码器使用 2D-RoPE 与 3×3 像素重排下采样,再接两层 MLP 投影器;图像与文本从语言模型预训练的第一天起就联合处理。语料规模 45T token,稀疏注意力按 64K 序列长度训练,在 34T token 处把上下文扩展到 1M。
推理强度是旋钮,不是三档开关
V4.1 Flash 接受 1 到 100 的 reasoning_effort 取值——连续可调,而不是常见的低/中/高三档。整个模型就是围绕这个权衡建的:后训练阶段的改动几乎全在数据管线,即自动化合成智能体任务与环境,而不是算法层面。
模型卡报告了什么
厂商自己的表格,取最大推理强度。最后一列给出同一张表里的最佳竞品成绩,因此 V4.1 Flash 落后的行与领先的行一样可见。
| 基准 | DeepSeek V4.1 Flash | 同表最佳竞品 |
|---|---|---|
| Terminal-Bench 2.1 | 90.6 | Opus-5.0 — 89.1 |
| Terminal-Bench 3.0 | 30.0 | Opus-5.0 — 43.3 |
| DeepSWE v1.1 | 74.2 | Opus-5.0 — 74.0 |
| NL2Repo-Bench | 64.0 | Opus-5.0 — 75.3 |
| CyberGym | 88.1 | GPT-5.6 Sol — 84.5 |
| HLE(带工具) | 63.9 | Opus-5.0 — 63.6 |
| Automation-Bench | 54.8 | Opus-5.0 — 50.3 |
| GPQA Diamond | 90.9 | GPT-5.6 Sol — 94.1 |
| HLE | 36.8 | Opus-5.0 — 56.3 |
| Codeforces(评分) | 3471 | DeepSeek-V4-Pro — 3348 |
DeepSeek 说明在其自有的基础模型评测中,差距在 0.3 以内视为等同。模型卡也提醒,智能体成绩高度依赖测试框架:同一个模型在 DeepSWE v1.1 上,用 mini-SWE 得 74.2,用 Codex 得 65.6。
有据可查的规格
以下每一行都写在 DeepSeek 的模型卡或技术报告中。
- 开发者
- DeepSeek
- 模型
- DeepSeek V4.1 Flash
- 架构
- Causal Encoder-Decoder,20 + 20 层
- 骨干参数
- 552B
- 激活参数
- prefill 8B · decode 16B
- 专家
- 1 共享 + 384 路由,每 token 激活 6 个路由专家
- 上下文
- 最高 1,000,000 token
- 预训练语料
- 45T 多模态 token
- 视觉编码器
- DeepSeek-ViT,从头训练
- KV 缓存
- 每 token 890 字节
- 推理强度
- 1–100 连续可调
- 许可
- MIT
官方公布的接入渠道
DeepSeek 这一款是以「可下载权重 + 附技术报告」的形式发布的,托管交给使用者或服务商。因此许可条款是第一件要读的事,而不是最后一件。
DeepSeek V4.1 Flash 常见问题
DeepSeek V4.1 Flash 真的是多模态吗?
是。它接受文本与图像输入、输出文本。图像先经过从头训练的 DeepSeek-ViT 编码器(2D-RoPE 与 3×3 像素重排下采样),再由两层 MLP 投影器接入。模型卡报告 DocVQA 95.6、RefCOCO-avg 86.0、MMMU-Pro 56.5。
每 token 890 字节在实际使用中意味着什么?
这是模型每处理一个 token 上下文所必须保留的全局 KV 缓存大小。同一指标在 V4-Flash 上是 3,514 字节,在初代 DeepSeek-V1 上是 389,120 字节——百万 token 请求的服务成本因此是数量级的变化,而不是几个百分点。
我能在本地跑吗?
仓库、推理目录与评测目录假设的都是正经硬件:552B 骨干,prefill 阶段激活 8B、decode 阶段激活 16B。DeepSeek 记录了权重转换流程与推荐采样参数,但没有公布最低硬件要求,本页也不会替它编一个。
权重是什么许可?
MIT。仓库与模型权重都是 MIT 许可,这在这一量级的模型里并不常见,意味着许可本身既没有营收门槛,也没有用户数条款。
API 多少钱?
DeepSeek 的模型卡没有公布按 token 计费的价格,本页也不会去猜。托管服务的价目表在 DeepSeek 自家平台上。模型卡确实公布了推荐的采样配置:temperature 1.0、top_p 0.95 或 1.0、100 万 token 上下文窗口,以及至少 256K 的输出 token。
reasoning_effort 是什么,为什么是 1 到 100?
它是一个连续的旋钮,而不是三个命名档位:1 到 100 的任意整数都可以在推理成本与准确率之间取点。上表中所有 instruct 成绩都在 100 这一最大强度下测得。
为什么是把上下文扩到 1M,而不是直接在 1M 上训练?
按厂商自己的说明,稀疏注意力按 64K 序列长度训练,在 45T 训练 token 中的第 34T 处把上下文扩展到 1M。这个训练安排也正是压缩工作重要的原因:长上下文只有在所需缓存足够小时才有意义。