推荐搜索

GPT Image 简介 GPT Image 免费指南 GPT Image 开发文档 Midjourney 简介 Midjourney 免费指南 Midjourney 开发文档 Google Nano Banana 简介 Google Nano Banana 免费指南 Google Nano Banana 开发文档 Adobe Firefly Image 简介 Adobe Firefly Image 免费指南 Adobe Firefly Image 开发文档 FLUX 简介 FLUX 免费指南 FLUX 开发文档 Ideogram 简介 Ideogram 免费指南 Ideogram 开发文档 Recraft 简介 Recraft 免费指南 Recraft 开发文档 Stable Diffusion 简介 ByteDance Seedream 简介 Grok Imagine Image 简介 Google Veo 简介 Google Veo 免费指南 Google Veo 开发文档 Runway 简介 Kling AI 简介 ByteDance Seedance 简介 ByteDance Seedance 免费指南 ByteDance Seedance 开发文档 Luma AI 简介 Adobe Firefly Video 简介 Adobe Firefly Video 免费指南 Adobe Firefly Video 开发文档 Hailuo AI 简介 PixVerse 简介 PixVerse 免费指南 PixVerse 开发文档 Pika 简介 Pika 免费指南 Pika 开发文档 Alibaba Wan 简介 LTX Video 简介 Grok Imagine Video 简介 Google Gemini 简介 Google Gemini 免费指南 Google Gemini 开发文档 OpenAI GPT 简介 Claude Fable 简介 Claude Fable 免费指南 Claude Fable 开发文档 DeepSeek 简介 Qwen 简介 Llama 简介 Codex 简介 Codex 免费指南 Codex 开发文档 Cursor 简介 Cursor 免费指南 Cursor 开发文档 OpenClaw 简介 OpenClaw 免费指南 OpenClaw 开发文档 Perplexity 简介 ElevenLabs 简介 Suno 简介 Manus 简介 Claude 与 ChatGPT 怎么比:不借第三方数字 Claude 与 Gemini 怎么比:只有一侧能打开官方页面时 Adobe Firefly 免费吗:免费会员、积分与首年特惠 Adobe Firefly 价格:档位、生成积分与一张图的成本 Adobe Firefly Video 费用:每秒多少点、一条多少点 Adobe Firefly Video 免费吗:免费档的边界在哪 FLUX.2 提示词指南:官方文档写明的提示词结构 FLUX.2 与 Nano Banana Pro 对比:只看两家官方公布的部分 Ideogram 4.0 提示词指南:官方结构怎么用,文字怎么落对 Ideogram 价格:档位、积分与免费额度 Midjourney 提示词指南:结构、七类元素与 Edit Model 指令 Midjourney 价格:四档订阅、GPU 小时与一次任务花多少 Nano Banana Pro 价格:官方公布了什么,没公布什么 Nano Banana Pro 对比 Midjourney:哪个更适合你的工作流 Pika 积分:一条 Pika 2.5 视频花多少积分 Pika 免费吗?$0 档到底给什么 PixVerse 积分多少钱:先分清你在付哪本账 PixVerse 免费吗?两个免费档,各自要付什么 Recraft V4.1:八个变体怎么选 Recraft 价格与免费套餐:官方公布了哪些数字 Seedance 官网在哪:官方入口只有三个 Seedance 2.5 与 2.0 对照:官方公布的那几行 Veo 3.1 与 Sora 2 对比:两家官方页面各自还确认了什么 Veo 3.1 与可灵 3.0 对比:两家官方各自公布了什么 Claude 免费吗?$0 方案实际给了你什么 Claude 价格方案:Pro、Max 5x 与 Max 20x 怎么选 Adobe Firefly 怎么用:从入口到第一张图(Adobe Firefly Image 5) Adobe Firefly API 开发者接入:凭证、异步端点与 Image5 结构 Adobe Firefly Video 怎么用 Adobe Firefly 视频 API:/v3/videos/generate 端点解析 用 GPT Image 2.5 生成界面稿与 App Mockup 用 GPT Image 2.5 做表情包与透明贴纸 Nano Banana Pro 提示词指南:三份官方框架 Nano Banana Pro 免费吗?Google 官方到底确认了什么 Pika 2.5 怎么用:从官方入口到第一条视频 Pika API:官方开发者站、两层计费与调用三跳 PixVerse 怎么用:从选模型到第一条视频 PixVerse API 接入:独立平台、端点与积分 ByteDance Seedance 2.5 怎么用 Seedance API 接入:真实端点、模型 ID 与字段 Veo 3.1 提示词指南:Google 亲口点名的七个要素 Veo 3.1 价格与免费额度:官方公布了哪些数字 Claude 怎么用:从第一次对话到稳定产出 Claude API 接入:从 API key 到第一次调用 FLUX.2 怎么用:从官方入口到第一张图 FLUX.2 API 接入:官方 API 上手指南 GPT Image 2.5 与 DALL·E 3 怎么选 用 GPT Image 2.5 做信息图与流程图 Ideogram 怎么用:从注册到第一张带字的图 Ideogram API:接入、端点与图上文字渲染 Midjourney V8.2 怎么用 Midjourney API:有什么、没有什么 Nano Banana Pro 怎么用:从第一张图到可编辑的成品 Nano Banana Pro API 接入:从拿 key 到第一个请求 Recraft 怎么用:从注册到第一张可编辑矢量图 Recraft API 接入:官方端点、鉴权与风格一致性 Veo 3.1 怎么用:从第一条视频到能接着往下写 Veo 3.1 API 计费与 Vertex AI 接入 GPT Image 2.5 提示词分享 GPT Image 2.5 和 Nano Banana 2 怎么选 GPT Image 2.5 和 Seedream 5.0 Pro 对比 GPT Image 2.5 和 FLUX 2 对比 GPT Image 2.5 和 Ideogram 对比 GPT Image 2.5 免费吗 GPT Image 2.5 Sketch 草图怎么用 GPT Image 2.5 模板功能 GPT Image 2.5 评论标注 GPT Image 2.5 形象一致性 GPT Image 2.5 多图合成 GPT Image 2.5 中文文字渲染 GPT Image 2.5 是什么 GPT Image 2.5 API 总览 Codex 和 ChatGPT:编码场景下该用哪一个? Codex CLI、IDE 扩展、应用还是云端:按场景选择使用形态 你的第一个 Codex 低风险编程任务:从建基线到回滚 Cursor 是什么?它的 AI 编程工作流详解 Cursor 和 VS Code:哪款编辑器更适合你的工作流? Cursor 功能详解:Agent、Tab、上下文与更多 Gemini 是什么?模型、应用、Google AI Studio 与 API 一文讲清 Gemini Apps 与 Gemini API:根据任务选对工具 Gemini 能做什么?一份实用的能力指南 OpenClaw Foundation 是什么:治理、归属与独立性 OpenClaw Skill Workshop 使用指南:审查可复用技能 OpenClaw Skill Card:读懂 ClawHub 技能安全扫描 OpenClaw 2.0 更新指南:新功能、升级检查与使用变化 OpenClaw LTS 与 extended-stable 怎么选:版本通道指南 OpenClaw 安装教程:桌面版、脚本、npm 与源码方式对比 OpenClaw Node.js 环境配置:版本要求、安装与 PATH 排障 如何编写更好的 Codex 提示词:实用框架 提交前如何审查 Codex 代码变更 Cursor 新手入门教程:从安装到完成第一次代码修改 Cursor Rules 教程:项目规则、用户规则与 AGENTS.md Cursor Windows 安装与中文设置教程 Cursor MCP 配置教程:连接、验证与安全设置 Gemini 提示词怎么写:结构、模板与优化方法 Gemini API 教程:Key、Python SDK 与首次调用 Gemini 网页版使用教程:登录、文件与隐私设置 Gemini API Key 创建与安全配置指南 Codex 是什么?从能力边界到使用入口的完整解释 Codex 新手教程:从选择项目到验收第一个任务 Codex CLI 安装教程:登录、首次运行与安全检查 Codex AGENTS.md 指南:发现顺序、分层规则与验证方法 Codex CLI 常用命令:交互、状态、审查与自动化 Gemini怎么用:网页版、安卓与iPhone安装指南 Gemini功能详解:对话、文件、绘图与Gemini Live Gemini AI对话指南:提示词、追问与Gemini Live Gemini AI绘图指南:图片生成、提示词与编辑方法 Gemini与GPT-4对比:功能、限制和适用场景 Gemini AI助手指南:手机、应用连接与隐私设置 Gemini 提示词工程指南:方法、模板与示例 Gemini 对话 API 指南:Python 多轮聊天示例 Gemini 系统指令指南:API 用法与 Python 示例 Gemini 上下文缓存指南:成本、延迟与 API 示例
AI Tool Blog DeepSeek V4.1 Flash 学习中心

先读懂 DeepSeek V4.1 Flash 的 KV 缓存数字。

DeepSeek V4.1 Flash 是 DeepSeek 当前的模型,它的技术报告围绕一个数字展开:每个 token 需要多少全局 KV 缓存。890 字节约为 V4-Flash 的四分之一、初代 DeepSeek 的 437 分之一——正是这个数字让百万 token 的智能体负载变得可负担。

本页的规格、评测与架构说明均来自 DeepSeek 自己的 V4.1 Flash 模型卡与技术报告。权重以 MIT 许可发布,但模型卡没有公布按 token 计费的价格。

官方图示

DeepSeek 为 V4.1 Flash 公布的两张图

模型卡带了两张图:一张智能体评测对比,一张是 KV 缓存跨四代模型的下降曲线。DeepSeek 其它页面都用 JavaScript 绘制数字,所以这是官方仅有的静态图。

DeepSeek 公布的 V4.1 Flash 智能体评测图,对比 Kimi-K3、GLM-5.3、Opus 5 与 GPT-5.6 Sol
智能体评测:DeepSeek V4.1 Flash 对比 Kimi-K3、GLM-5.3、Opus 5 与 GPT-5.6 Sol。V4.1 Flash 在 DeepSWE v1.1(74.2)、CyberGym(88.1)与 Automation-Bench(54.8)上领先,在 Terminal-Bench 3.0 上落后,得分 30.0,Opus 5 为 43.3。
DeepSeek 公布的每 token 全局 KV 缓存字节数曲线,从 V1 一路降到 V4.1 Flash
每 token 全局 KV 缓存(字节),横跨四代模型:DeepSeek-V1 在 2023 年 11 月为 389,120,V3.2 在 2025 年 12 月为 48,068,V4-Flash 在 2026 年 4 月为 3,514,V4.1 Flash 在 2026 年 9 月为 890——相对上一代依次缩小 8.1 倍、13.7 倍与 3.9 倍。

两张图版权归 DeepSeek 所有,转载时已署名: DeepSeek V4.1 Flash 模型卡

它是什么

DeepSeek 如何描述 V4.1 Flash

DeepSeek 给技术报告的标题是「Pushing the Limits of KV Cache Compression」,数字也支撑这个标题。这是一款靠长上下文的持有成本取胜的模型,而不是靠拿下每一个榜单。

01

卖点是显存,不是单纯的分数

每 token 全局 KV 缓存 890 字节,约为 V4-Flash 3,514 字节的四分之一,比 V1 的 389,120 字节小 437 倍。对以长上下文服务、输入极重的智能体负载来说,这是一台机器与一整个机柜的差别。

02

编码器-解码器共用一个缓存

V4.1 Flash 采用 40 层的 Causal Encoder-Decoder:20 层编码器接 20 层解码器,解码器的全局 KV 缓存由编码器最终隐状态投影而来,而不是逐层自行推导。DeepSeek 表示这正是 prefill 阶段每 token 只激活 8B、decode 阶段激活 16B 的原因。

03

三种静态模式的稀疏注意力

Compressed Sparse Attention 2 给每个注意力层指定 Full、Reindex 或 Reuse 三种模式之一,从而在层间共享主 KV 与索引器 K,并复用 Top-K 稀疏索引。解码器中还有分层稀疏索引器,把更深层索引的开销限制在与上下文长度无关的水平;FP4 主 KV 缓存则每 16 个通道存一个 E4M3 缩放。

04

预训练阶段就原生多模态

从头训练的 DeepSeek-ViT 编码器使用 2D-RoPE 与 3×3 像素重排下采样,再接两层 MLP 投影器;图像与文本从语言模型预训练的第一天起就联合处理。语料规模 45T token,稀疏注意力按 64K 序列长度训练,在 34T token 处把上下文扩展到 1M。

05

推理强度是旋钮,不是三档开关

V4.1 Flash 接受 1 到 100 的 reasoning_effort 取值——连续可调,而不是常见的低/中/高三档。整个模型就是围绕这个权衡建的:后训练阶段的改动几乎全在数据管线,即自动化合成智能体任务与环境,而不是算法层面。

官方评测

模型卡报告了什么

厂商自己的表格,取最大推理强度。最后一列给出同一张表里的最佳竞品成绩,因此 V4.1 Flash 落后的行与领先的行一样可见。

基准 DeepSeek V4.1 Flash 同表最佳竞品
Terminal-Bench 2.1 90.6 Opus-5.0 — 89.1
Terminal-Bench 3.0 30.0 Opus-5.0 — 43.3
DeepSWE v1.1 74.2 Opus-5.0 — 74.0
NL2Repo-Bench 64.0 Opus-5.0 — 75.3
CyberGym 88.1 GPT-5.6 Sol — 84.5
HLE(带工具) 63.9 Opus-5.0 — 63.6
Automation-Bench 54.8 Opus-5.0 — 50.3
GPQA Diamond 90.9 GPT-5.6 Sol — 94.1
HLE 36.8 Opus-5.0 — 56.3
Codeforces(评分) 3471 DeepSeek-V4-Pro — 3348

DeepSeek 说明在其自有的基础模型评测中,差距在 0.3 以内视为等同。模型卡也提醒,智能体成绩高度依赖测试框架:同一个模型在 DeepSWE v1.1 上,用 mini-SWE 得 74.2,用 Codex 得 65.6。

规格

有据可查的规格

以下每一行都写在 DeepSeek 的模型卡或技术报告中。

开发者
DeepSeek
模型
DeepSeek V4.1 Flash
架构
Causal Encoder-Decoder,20 + 20 层
骨干参数
552B
激活参数
prefill 8B · decode 16B
专家
1 共享 + 384 路由,每 token 激活 6 个路由专家
上下文
最高 1,000,000 token
预训练语料
45T 多模态 token
视觉编码器
DeepSeek-ViT,从头训练
KV 缓存
每 token 890 字节
推理强度
1–100 连续可调
许可
MIT
怎么用

官方公布的接入渠道

DeepSeek 这一款是以「可下载权重 + 附技术报告」的形式发布的,托管交给使用者或服务商。因此许可条款是第一件要读的事,而不是最后一件。

官方模型卡

架构说明、两张图、完整评测表与推荐的采样参数。

打开

技术报告

模型卡链接的 PDF,完整描述各项压缩方法。

打开

权重与许可

仓库与模型权重均为 MIT 许可——许可正文里没有用户数门槛,也没有超出适用法律的用途限制。

deepseek-recipe

一组带 Python 绑定的 Rust 库,把 Messages、Chat Completions 与 Responses 请求编码成 V4/V4.1 提示词,并把流式输出解析回来。

打开
常见问题

DeepSeek V4.1 Flash 常见问题

DeepSeek V4.1 Flash 真的是多模态吗?

是。它接受文本与图像输入、输出文本。图像先经过从头训练的 DeepSeek-ViT 编码器(2D-RoPE 与 3×3 像素重排下采样),再由两层 MLP 投影器接入。模型卡报告 DocVQA 95.6、RefCOCO-avg 86.0、MMMU-Pro 56.5。

每 token 890 字节在实际使用中意味着什么?

这是模型每处理一个 token 上下文所必须保留的全局 KV 缓存大小。同一指标在 V4-Flash 上是 3,514 字节,在初代 DeepSeek-V1 上是 389,120 字节——百万 token 请求的服务成本因此是数量级的变化,而不是几个百分点。

我能在本地跑吗?

仓库、推理目录与评测目录假设的都是正经硬件:552B 骨干,prefill 阶段激活 8B、decode 阶段激活 16B。DeepSeek 记录了权重转换流程与推荐采样参数,但没有公布最低硬件要求,本页也不会替它编一个。

权重是什么许可?

MIT。仓库与模型权重都是 MIT 许可,这在这一量级的模型里并不常见,意味着许可本身既没有营收门槛,也没有用户数条款。

API 多少钱?

DeepSeek 的模型卡没有公布按 token 计费的价格,本页也不会去猜。托管服务的价目表在 DeepSeek 自家平台上。模型卡确实公布了推荐的采样配置:temperature 1.0、top_p 0.95 或 1.0、100 万 token 上下文窗口,以及至少 256K 的输出 token。

reasoning_effort 是什么,为什么是 1 到 100?

它是一个连续的旋钮,而不是三个命名档位:1 到 100 的任意整数都可以在推理成本与准确率之间取点。上表中所有 instruct 成绩都在 100 这一最大强度下测得。

为什么是把上下文扩到 1M,而不是直接在 1M 上训练?

按厂商自己的说明,稀疏注意力按 64K 序列长度训练,在 45T 训练 token 中的第 34T 处把上下文扩展到 1M。这个训练安排也正是压缩工作重要的原因:长上下文只有在所需缓存足够小时才有意义。