先算清硬件,再看 Qwen3.8 Max。
Qwen3.8 Max 是阿里的旗舰模型,而 Qwen3.8 是 Max 级首次以开放权重形式发布的一代:托管版 Max 建立在已公开的 2.4 万亿参数检查点之上。它的架构是 3:1 混合——每三层线性注意力配一层稀疏注意力——这才让 262,144 token 的上下文在服务成本上说得通。
本页的架构、评测与许可条款均来自 Qwen 自己的模型卡与 Qwen3.8 发布博客。模型卡没有公布按 token 计费的价格,托管价格以 Qwen Cloud 为准。
Qwen 为 3.8 一代画出的架构图
Qwen 的模型卡只带一张静态图:混合注意力堆叠的模块图。2.4T 模型卡用文字描述了这套布局,而图来自同代的 Qwen3.8-Flash-Next 模型卡——它把它画了出来。
该图版权归 Qwen 所有,转载时已署名: Qwen3.8 Flash Next 模型卡
Qwen 如何描述 Qwen3.8 Max
Qwen 称 Qwen3.8 是自家开放模型家族中能力最强的一代,发布博客的标题是「Qwen3.8-Max: A New Bar for Coding and Cowork」。更有意思的是底下的架构:线性注意力与稀疏注意力的刻意混搭。
Max 级第一次开放
Qwen 称这是 Qwen-Max 级模型首次被公开发布,仓库名为 Qwen3.8-2.4T-A95B。托管版 Qwen3.8 Max 则是在这个检查点之上,叠加权重本身不具备的服务能力。
三层线性配一层稀疏
隐藏层布局是 23 ×(3 ×(Gated DeltaNet → MoE)→ 1 ×(Gated Attention → MoE)),共 92 层。Gated DeltaNet 的 value 侧有 128 个线性注意力头、QK 侧 16 个;稀疏路径用 64 个 Q 头配 4 个 KV 头,头维度 256。长上下文在成本上可行,靠的正是线性这一路。
超大字表与 N-gram 嵌入层
token 嵌入为 248,320 条(补齐后)。2.4T 模型卡还包含多步训练的多 token 预测,而这一代的模块图显示有一个 N-gram 嵌入层接入第二层。
Max 比裸权重多了什么
Qwen 的模型卡写得很明确:托管版 Max 增加了视觉输入、非思考模式、默认 100 万上下文,以及官方内置工具。已发布的权重是纯文本模型,且必须使用思考模式——模型卡写明在那里思考无法关闭。
评测面铺得异常宽
对比表覆盖编程智能体、通用智能体任务、法律/金融/医疗类专业工作,以及长上下文检索。宽度本身就是论点:Qwen 卖的是一名通用干活的模型,而不是编程模型,而表格也如实列出了它仍然落后的地方。
模型卡报告了什么
Qwen 自己的对比表,另加一列同表最佳竞品,让 Qwen3.8 Max 落后的行也保持可见。这是厂商自跑的表,竞品数字是各家自己公布的成绩。
| 基准 | Qwen3.8 Max | 同表最佳竞品 |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | GPT 5.6 Sol — 88.8 |
| SWE-bench Pro | 67.7 | Fable 5 — 80.0 |
| PaperBench | 93.0 | GPT 5.6 Sol — 90.5 |
| CoWorkBench | 74.8 | Fable 5 — 75.9 |
| WideSearch | 81.9 | Fable 5 — 81.2 |
| IFBench | 82.8 | GPT 5.6 Sol — 72.7 |
| GPQA Diamond | 92.6 | GPT 5.6 Sol — 94.1 |
| HLE | 43.6 | Fable 5 — 53.3 |
| HLE(带工具) | 56.2 | Fable 5 — 64.5 |
| MRCR v2 256K | 92.9 | GPT 5.6 Sol — 93.8 |
| HealthBench | 60.2 | GPT 5.6 Sol — 55.3 |
Qwen 用 Claude Code 框架以 average@10 自跑了 Terminal Bench 2.1,而其它模型取的是不同框架下的最佳已公布成绩——Claude 系取自 Artificial Analysis,GPT-5.6 Sol 取自 Codex。模型卡也注明 Fable 5 的结果可能涉及回退,并且表中有若干行是读者无法复现的内部基准。
有据可查的规格
以下每一行都写在 Qwen 关于 2.4T 检查点的模型卡中。
- 开发者
- 阿里 Qwen 团队
- 模型
- Qwen3.8 Max
- 开放权重
- Qwen3.8-2.4T-A95B
- 参数
- 2.4T 总参数,95B 激活
- 层数
- 92
- 隐藏层布局
- 23 ×(3 ×(Gated DeltaNet → MoE)→ 1 ×(Gated Attention → MoE))
- 专家
- 共 512 个,每 token 激活 10 路由 + 1 共享
- 词表
- 248,320(补齐后)
- 上下文
- 原生 262,144,可扩展至 1,010,000
- Max 额外能力
- 视觉输入、非思考模式、100 万上下文、内置工具
- 推理强度
- xhigh(默认)/ medium / low
- 许可
- Qwen3.8-Max 许可
官方公布的接入渠道
有两条路可走,而且不是同一个模型:可下载的 2.4T 检查点,或者在此基础上增加视觉、非思考模式与内置工具的托管版 Max。
Qwen3.8 Max 常见问题
Qwen3.8 Max 是开放权重吗?
算一半,而这个区分很重要。Qwen 公开了底层的 2.4T 检查点——Max 级首次享有这一待遇——但托管版 Qwen3.8 Max 另外增加了视觉输入、非思考模式、默认 100 万上下文与官方内置工具,这些检查点都没有。许可是自定义的 qwen3.8-max 许可,不是 OSI 许可。
我能在自己的硬件上跑吗?
这是 2.4T 参数、每 token 激活 95B 的模型,属于数据中心级别,而不是工作站级别。Qwen 记录了通过 SGLang、vLLM 与 TokenSpeed 部署的方式,并建议使用最新框架版本;但没有公布最低硬件要求。
上下文窗口有多大?
原生 262,144 token,可扩展至 1,010,000。托管版 Max 默认以 100 万上下文运行。在 Qwen 自己的 MRCR v2 256K 检索测试中,该模型得 92.9,GPT 5.6 Sol 为 93.8,上一代 Qwen3.7-Max 为 86.7。
为什么模型卡说思考不能关闭?
因为已发布的检查点是纯文本模型,每次交互都必须走思考模式:那里不支持多模态输入,每个回答都会先输出推理再给最终结果。非思考支持是 Qwen 留给托管版 Max 的能力之一。
怎么控制它思考多少?
通过 reasoning_effort,可取 xhigh(默认)、medium 或 low。另一个开关 preserve_thinking 默认开启,会保留历史消息里的推理上下文。Qwen 推荐 temperature 1.0、top_p 0.95、top_k 20、min_p 0.0、presence_penalty 0.0、repetition_penalty 1.0。
Qwen3.8 Max 多少钱?
Qwen 的模型卡没有公布按 token 计费的价格,因此本页也不给数字。模型卡指向 Qwen Cloud 提供托管推理,具体价格以它的模型页为准。
它真的比闭源前沿模型更好吗?
分项看。在 Qwen 自己的表里,Qwen3.8 Max 在 PaperBench(93.0 对 90.5)、WideSearch 与 IFBench 上领先,在 SWE-bench Pro(67.7 对 80.0)、HLE(43.6 对 53.3)与 Terminal Bench 2.1(86.6 对 88.8)上落后。表中有若干行是 Qwen 的内部基准,模型卡也注明不同模型用了不同的测试框架。