下载权重之前,先看懂 Llama 4 Maverick。
Llama 4 Maverick 是 Meta 的开放权重旗舰:一个每 token 激活 170 亿参数的专家混合模型,共 128 个专家,上下文窗口 100 万 token。当决定因素是许可而不只是分数时,团队会选择它——而许可恰恰是大多数简介略过的那部分。
本页所有数字均来自 Meta 公布的 Llama 4 模型卡、Llama 4 社区许可与 Llama Models 仓库。这里没有图廊:Meta 没有为 Llama 4 系列发布任何静态官方图示,与其用我们无权复制的图片来凑,不如不放。Meta 的产品导航现已以其 Muse 系列为主,它原先提供的 Llama 4 模型页已无法访问;模型卡、权重与许可条款没有变化。
Meta 如何描述 Llama 4
Meta 把 Llama 4 以两种规模发布,并称二者都是原生多模态的专家混合模型。选哪一个,取决于你要买的是上下文还是能力。
一个系列,两个模型
Scout 押的是上下文:17B 激活、16 个专家、109B 总参数、1000 万 token 窗口,训练语料约 40T token。Maverick 押的是能力:17B 激活、128 个专家、400B 总参数、100 万窗口,训练语料约 22T token。
早期融合带来的原生多模态
两者都在预训练早期就把图像与文本融合,而不是给文本模型外挂一个视觉适配器。模型卡写明输入为多语言文本与图像,输出为多语言文本与代码,支持 12 种语言:阿拉伯语、英语、法语、德语、印地语、印尼语、意大利语、葡萄牙语、西班牙语、他加禄语、泰语与越南语。
22T token,以及一个必须先确认的截止日期
模型卡给出的 Maverick 语料规模约为 22T token,知识截止为 2024 年 8 月,并说明这些模型是静态的、在离线数据集上训练。你此刻下载到的权重里没有那之后的信息;Meta 表示随着社区反馈积累,未来可能发布新的微调版本。
这份许可不是开源许可
Llama 4 以《Llama 4 社区许可协议》发布,属于自定义商业许可。它授予全球范围、非独占、免版税的使用与修改权,但附加了条件:一旦月活用户超过 7 亿,必须向 Meta 申请许可;必须显著展示「Built with Llama」;衍生模型名称必须带「Llama 4」前缀。此外还叠加了可接受使用政策。
训练数据从哪来
Meta 把语料描述为「公开可获取数据与授权数据,加上来自自家产品与服务的信息」——明确包括公开分享的 Instagram 与 Facebook 帖子,以及用户与 Meta AI 的交互,并在模型卡里给出了隐私中心链接。这段披露写在模型卡里,不是外界的推断。
Llama 各代如何对比
Llama 4 的两行来自 Meta 公布的模型卡;另外两个旧型号列出来是为了显示跨度。
| 模型 | 架构 | 上下文长度 |
|---|---|---|
| Llama 4 Maverick | MoE — 400B 中激活 17B,128 专家 | 1M |
| Llama 4 Scout | MoE — 109B 中激活 17B,16 专家 | 10M |
| Llama 3.1 405B | 稠密 — 405B | 128K |
| Llama 3.3 70B | 稠密 — 70B | 128K |
Meta 自己的评测显示,Maverick 在 MMLU(85.5 对 85.2)、MMLU-Pro(62.9 对 61.6)、MATH(61.2 对 53.5)与 MBPP(77.6 对 74.4)上均优于 Llama 3.1 405B——总参数量相近,但每 token 只激活 17B。
模型卡记录了哪些能力
Meta 发布的是规格与评测表,而不是示例图片,因此这一节放的是模型卡真正作出的能力声明。
原生的图像推理
在 Meta 的指令微调表中,Maverick 的 MMMU 为 73.4、MMMU Pro 为 59.6、MathVista 为 73.7;在预训练表中,ChartQA 为 85.3、DocVQA 为 91.6。
百万 token 窗口
Maverick 为 1M,Scout 为 10M,均为模型卡数值。Meta 没有为这些数字配套发布检索基准,因此请把它当作容量,而不是已验证的长上下文能力。
支持 12 种语言
阿拉伯语、英语、法语、德语、印地语、印尼语、意大利语、葡萄牙语、西班牙语、他加禄语、泰语与越南语。预训练覆盖 200 种语言,许可也允许微调到这 12 种之外的语言。
专家混合带来的效率
400B 总参数中每 token 只激活 17B。这正是该架构的意义:以很小一部分单 token 算力换接近大模型的质量——前提是你有足够的显存装下这些专家。
允许微调与蒸馏
模型卡把合成数据生成、蒸馏以及在对预训练模型再做适配列入支持用途,许可也授予衍生作品权——前提是满足命名、署名与可接受使用条件。
训练成本也是公开的
Meta 公布了训练足迹:Maverick 用 238 万 H100-80GB GPU 小时,Scout 用 500 万,合计 738 万小时;基于位置的碳排放为 1,999 吨 CO2 当量,按市场口径计为 0。很少有厂商把这项写进模型卡。
有据可查的规格
以下每一行都写在 Meta 公布的 Llama 4 模型卡或社区许可协议中。
- 开发者
- Meta
- 模型
- Llama 4 Maverick(17B×128E)
- 同系列另有
- Llama 4 Scout(17B×16E)
- 总参数
- 400B(Maverick)· 109B(Scout)
- 激活参数
- 每 token 17B
- 专家数
- 128(Maverick)· 16(Scout)
- 上下文长度
- 1M(Maverick)· 10M(Scout)
- 输入模态
- 多语言文本与图像
- 输出模态
- 多语言文本与代码
- 训练语料
- 约 22T token(Maverick)· 约 40T(Scout)
- 知识截止
- 2024 年 8 月
- 发布日
- 2025 年 4 月 5 日
- 许可
- Llama 4 社区许可
官方公布的接入渠道
Llama 4 提供的一切都以下载形式交付:权重、模型卡、许可,以及拉取它们的命令行工具。Meta 没有为这个模型提供托管端点。
Llama 4 Maverick 常见问题
Llama 4 是开源的吗?
不是,这个区分值得保留。权重可以下载,对多数使用者也是免版税的,但它依据的是《Llama 4 社区许可协议》——自定义商业许可,而非 OSI 认可的许可。它附加了 7 亿月活门槛、「Built with Llama」展示规则,以及衍生模型的命名规则。
7 亿月活条款到底怎么写的?
如果在模型发布日,你或你的关联方所提供产品或服务的月活跃用户数在上一个自然月超过 7 亿,你必须向 Meta 申请许可,且在 Meta 明确授予之前不得行使协议项下的任何权利。
上下文有多长?
Maverick 为 1M token,Scout 为 10M token,都来自 Meta 的模型卡。Meta 没有为这些数字配套发布检索基准,因此它们描述的是容量,不是实测的长上下文准确率。
什么时候发布的,现在还算新吗?
Llama 4 于 2025 年 4 月 5 日发布,知识截止为 2024 年 8 月,Meta 称这些模型是静态的、在离线数据集上训练。Meta 更新的前沿工作已挂在 Muse 品牌下,产品导航也把这些模型排在前面;Llama 4 仍然照原条款发布、可下载、可授权使用。
可以微调吗?
可以。模型卡把合成数据生成、蒸馏以及对预训练检查点再做适配列入支持用途,许可也授予衍生作品权,但附带命名、署名与可接受使用条件。
能在本地跑吗?
Maverick 有 400B 参数,显存开销跟着总参数量走,而不是每 token 激活的 17B。Meta 没有公布最低硬件要求,模型卡描述的是训练配置而非部署配置。这不是一台笔记本能跑的模型。
它支持图像吗?
支持,而且是预训练早期就原生支持,不是外挂适配器。模型卡给出 Maverick 的 MMMU 为 73.4、MMMU Pro 为 59.6,Scout 分别为 69.4 与 52.2。