多数「Claude 对 DeepSeek」的文章靠一个排名收尾,排名需要一个数字,而那个数字通常属于跑测试的那个人。拿它决定预算并不牢靠。
所以本文换个更窄的写法:两列都来自两家厂商自己的文档;某一侧没有公布的行,格子就照实标成未公布,不拿别处的数字来填。
为什么价目表比排行榜活得久
你要选的不是「最好的模型」,而是一个能扛住具体负载的模型。决定这件事的往往是两条公开事实:在你的用量下每百万 token 花多少钱,以及这个模型到底做不做得动这件事。
价目表有三样排行榜没有的东西。两家厂商都公布它,它带日期,读者一分钟内就能回去核对。排行榜三样都没有,所以榜单类页面烂得特别快。
Anthropic 公布了什么,在哪一页
Anthropic 的定价页列了当前四个模型,单位都是每百万 token。Claude Fable 5.1 是 $10 输入、$50 输出,缓存读取 $0.25、缓存写入 $12.50。Claude Opus 5 是 $5 与 $25,Claude Sonnet 5 是 $2 与 $10,Claude Haiku 4.5 是 $1 与 $5。有两条脚注和表格本身一样重要:批量处理打五折,缓存费率按五分钟 TTL 计算。
个人档按档位定价。Free 是 $0,Pro 按年付口径每月 $17、月付 $20,Max 从每月 $100 起,可选 Pro 的五倍或二十倍用量。页面自己也写了边界:价格不含适用税费,方案由 Anthropic 自行决定是否调整。
有一页没能打开。platform.claude.com 的模型总览跳转到了区域提示页,而不是文档本身,所以本文没有一个字取自那页——包括最大输出 token 数,这正是表里那一行写成未公布的原因。

DeepSeek 那一列,来自 DeepSeek 自己的文档
DeepSeek 的 API 文档列了两个正式模型:deepseek-flash,也就是当前的 DeepSeek-V4.1-Flash,以及 deepseek-v4-pro。两者的上下文长度都是 1M,最大输出 384K token,并且都有思考与非思考两种模式,默认走思考模式。
费率出现两次,因为时段会改价:闲时是高峰价的一半,高峰时段是 UTC 周一至周五 01:00–04:00 与 06:00–10:00。闲时下,deepseek-flash 每百万输入 token 缓存未命中 $0.15、命中 $0.003,每百万输出 token $0.60;deepseek-v4-pro 的同样三个数字是 $0.66、$0.022 和 $1.98。
有意思的是那个端点
DeepSeek 自己公布了一个 Anthropic 格式的 base URL:https://api.deepseek.com/anthropic。它的兼容表写明 x-api-key 完全支持,anthropic-version 被忽略,temperature 接受 0.0 到 2.0,而 top_p 只在思考模式下生效。
模型名是映射的,不是原样透传。以 claude-opus 开头的名字会变成 deepseek-v4-pro,claude-haiku 或 claude-sonnet 开头的会变成 deepseek-flash,认不出来的名字回落到 deepseek-flash。为一家厂商写的代码可以原样跑,账单记到另一家头上。
两家都在讲窗口,讲法不一样
Anthropic 帮助中心写的是:窗口取决于你用的是哪个模型,付费档最新模型最高 1M token,其余支持 500K 或 200K。而它的方案对照表里那一行只写了一个数字——Free、Pro、Max 5x、Max 20x 都是 200k。两句话都是 Anthropic 自己说的,却分在不同页面上,只引一句,给到的信息就是不完整的。
逐格对照
| 对比项 | Claude,厂商页面 | DeepSeek,厂商页面 |
|---|---|---|
| 当前模型 | Claude Fable 5.1、Claude Opus 5、Claude Sonnet 5、Claude Haiku 4.5 | deepseek-flash、deepseek-v4-pro |
| 每百万输入 token | $1 至 $10,按模型 | 闲时缓存未命中 $0.15 至 $0.66 |
| 每百万输出 token | $5 至 $50,按模型 | 闲时 $0.60 至 $1.98 |
| 每百万缓存读取 | $0.10 至 $0.25,按模型 | 闲时 $0.003 至 $0.022 |
| 上下文长度 | 付费档最新模型最高 1M;方案对照行写的是 200k | 两个模型都是 1M |
| 最大输出 token | 官方未公布 | 两个模型都是 384K |
| 批量折扣 | 批量处理五折 | 官方未公布 |
| 分时段计价 | 无公布 | 闲时为高峰价一半,高峰是 UTC 工作日的两个时段 |
| Anthropic 格式端点 | 该格式的制定方 | https://api.deepseek.com/anthropic |
| 并发上限 | 官方未公布 | flash 2,500、pro 500,按账号计 |
| 个人订阅 | Free $0,Pro 年付口径每月 $17,Max 每月 $100 起 | 官方未公布 |
有几个格子写的是同一句话,原因也相同。标出来的格子说的是页面的事实,不是对产品的判断;打不开的页面就没法引用。
案例:把两张价目表变成一次决策
下面两条提示词,各自在新对话里运行,把上面的表格贴在后面。
案例一,月度账单。 重点不在算术,而在于逼模型说出它做了哪些假设。
Use only the numbers below. If a number you need is missing, write
"not published" instead of estimating it.
Anthropic API, per million tokens: Fable 5.1 $10 in / $50 out, cache read
$0.25. Sonnet 5 $2 in / $10 out, cache read $0.20. Batch processing is 50%
off. Caching rates assume a 5-minute TTL.
DeepSeek API, per million tokens, off-peak: deepseek-flash $0.15 in on a
cache miss, $0.003 on a cache hit, $0.60 out. deepseek-v4-pro $0.66 in on a
cache miss, $0.022 on a cache hit, $1.98 out. Off-peak is half of peak.
My workload: 200 million input tokens a month, 90% of them repeating one
stable prefix, and 20 million output tokens.
Print a table of model, input cost, output cost and monthly total. Then one
line listing every assumption you had to make, and one line naming any cell
of the rate cards you could not find.
产出是四行表格,以及表格下面那部分才值得留下的东西。模型指出:它无法知道重复前缀里究竟有多少比例真的命中缓存;要拿到闲时价,就得给任务排期;批量折扣只有一侧有。这三句才是决策本身,总额是从它们推出来的。
案例二,不改代码换一家。 DeepSeek 公布的那组环境变量,正是为这件事写的。
Write a shell snippet for macOS that exports these variables, in this order,
with the token read from an existing variable named DEEPSEEK_KEY:
ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
ANTHROPIC_AUTH_TOKEN=$DEEPSEEK_KEY
ANTHROPIC_MODEL=deepseek-flash[1m]
Then explain in three bullets what each variable changes. Invent no other
variable name, and use no value you were not given.
回信是三行要点加一行补充:既然那个端点按前缀映射模型家族,那么仍然发着 Claude model id 的客户端会被接受,并按另一家的费率计费。这一条在 DeepSeek 自己的兼容表里就能核对,它决定了换厂商是改配置还是改代码。同一套格式在另一侧的请求长什么样,Claude API 接入指南里有。
两家都没有公布的东西
Anthropic 没有为任何档位公布固定消息条数,也没有公布周限额的数值。它自己的说法是:限额按五小时滚动会话窗口重置,付费档在其上再加周限额,撞到之后有等、升级、买 usage credits 三条路。credits 的换算率同样没有公布,所以从 Pro 用到顶级模型的成本无法提前算出来。价格方案拆解逐个档位讲了已公布的部分。
DeepSeek 的 API 文档里没有批量折扣,也没有面向个人的订阅价格,因为个人定价不在 API 文档的范围内。它公布得很细的是兼容面,细到哪些消息类型被接受、哪些被忽略。
常见问题
哪个更便宜? 就公布的价目表而言,DeepSeek 在输入、输出和缓存读取三行上都更低,闲时再打对折。放到你的负载上是否成立,取决于输入、输出与缓存命中的比例,所以上面第一条提示词要的是账单,不是结论。
现有的 Claude Code 能指向 DeepSeek 吗? DeepSeek 公布了 Anthropic 格式的 base URL 和对应的环境变量,客户端不用改。Claude Code 终端指南讲的是客户端那一侧,模型映射则决定账单记给谁。
两边的 1M 窗口是一回事吗? Anthropic 把数字同时绑在模型和档位上,既公布了区间,也有一行按档位的值。DeepSeek 给两个模型一个数字。数字对得上,数字周围的结构对不上。
这些费率能维持多久? 两个页面都没有写到期时间。Anthropic 说明价格与方案由它自行决定是否调整,DeepSeek 保留调整价格的权利。同一套方法用在另一对模型上,在 Claude 与 ChatGPT 对比里。
能在一分钟内复核的两列,比只能选择相信的一列强。