按你的方式跑 Stable Diffusion 3.5。
Stable Diffusion 3.5 是 Stability AI 的开源图像模型系列:三个规模都公开了权重,从 81 亿参数的专业模型,到能在消费级硬件上开箱运行的 Medium 版;许可以下的大部分商用都免费。
本页的能力与规格均来自 Stability AI 官方页面与公开的模型文档。许可条款与价格由厂商设定,随时可能变动。
Stable Diffusion 3.5 能画出什么
以下示例取自 Stability AI 的 SD3.5 发布公告与官方图像模型页,覆盖这一系列主打的几项能力:写实、画面内的文字、提示词还原度,以及风格跨度。
示例图片版权归 Stability AI 所有,引用时注明来源: Stability AI 图像模型页
Stable Diffusion 3.5 是什么
Stable Diffusion 3.5 是 Stability AI 的开源图像模型系列,以三种规模发布并公开权重。它在本站比较特殊的地方是交付方式:与那些只有 API 的模型不同,SD3.5 可以自托管、微调,并在官方公布的营收门槛以下免费商用。
三种规模,三种任务
Large 是 81 亿参数的专业模型;Large Turbo 是蒸馏版,大约四步就能出高质量结果;Medium 是 25 亿参数、为消费级硬件开箱运行而设计的版本。
拿得到手的权重
三个版本都发布在 Hugging Face 上,推理代码在 GitHub,因此可以微调、优化,甚至完全离线运行。
许可带有营收门槛
Stability AI 社区许可对非商业用途免费,对年营收低于 100 万美元的商用也免费;超过门槛需要企业许可。无论哪种情况,生成内容的归属都归你。
厂商自己承认的取舍
Stability 写明:同一提示词在不同随机种子下产生差异是刻意保留的,为的是保住更广的知识面与多样风格;也因此,写得不够具体的提示词可能得到更不确定、审美更不稳定的结果。
SD3.5 各版本与托管服务
Stability AI 官方记录了三个可下载的 SD3.5 版本,外加两个命名托管服务。下表总结官方对每个选项的定位,措辞来自厂商本身。
| 版本 | 官方文档的描述 | 适合场景 |
|---|---|---|
| Stable Diffusion 3.5 Large | 81 亿参数;该系列中最强的模型,提示词还原度最好。 | 1 百万像素规模的专业用途。 |
| Stable Diffusion 3.5 Large Turbo | Large 的蒸馏版本,大约四步即可得到高质量输出,速度明显更快。 | 看重速度的批量生成与反复迭代。 |
| Stable Diffusion 3.5 Medium | 25 亿参数,采用改进的 MMDiT-X 架构,为消费级硬件开箱运行而设计。 | 本地生成 0.25 至 2 百万像素的图像。 |
| Stable Image Ultra | 托管服务,由包括 SD3.5 在内的最先进 Stability 模型驱动,主打写实。 | 营销与广告用的产品图。 |
| Stable Image Core | 基于增强版 SDXL 的托管服务,为速度优化,价格约为 SDXL 的一半。 | 看重单张成本的高频生成。 |
Stability AI 还把 Stable Diffusion XL 与 SDXL Turbo 列为额外的图像模型。只有 SD3.5 的三个版本是开源权重发布;Stable Image Ultra 与 Core 是另有定价的 API 服务。
Stable Diffusion 3.5 擅长什么
以下每一条都来自 Stability AI 官方页面。厂商未公布的数据——准确率、与其他模型的对比得分——一律不写,而不是自行估算。
画面里的文字
官方文档称其文字质量达到前所未有的水平,拼写、字距、字形与间距的错误更少,并在发布示例中用清晰可读的字样加以展示。
提示词还原度
厂商自己的分析把 SD3.5 Large 放在「忠实跟随提示词」这一档的前列,并记录了它对涉及空间关系、构图与风格的长提示词的理解能力。
风格跨度
3D、摄影、绘画、线描,以及几乎任何视觉风格都是官方列出的输出——这也正是同一个基础模型能作为微调起点的原因。
输出多样性
官方文档写明,无需长篇提示词也能生成体现人群与场景多样性的图像,并强调不同随机种子之间的差异是刻意设计,而非缺陷。
可定制性
基础模型就是为被改造而设计的:Transformer 块中的 Query-Key Normalization 稳定了训练过程,也简化了下游的微调。
官方文档中的规格
整理自 Stability AI 官方页面与公开的模型文档。厂商没有公布的数据会直接写明,而不是给出估算值。
- 开发者
- Stability AI
- 开源权重版本
- SD3.5 Large · SD3.5 Large Turbo · SD3.5 Medium
- SD3.5 Large 参数量
- 81 亿
- SD3.5 Medium 参数量
- 25 亿
- SD3.5 Medium 输出范围
- 0.25 至 2 百万像素
- SD3.5 Large 输出
- 1 百万像素
- SD3.5 Medium 显存
- 发挥全部性能需 9.9 GB 显存(不含文本编码器)
- Large Turbo 步数
- 约 4 步
- 许可
- Stability AI 社区许可
- 商用
- 年营收低于 100 万美元免费;超过则需企业许可
- 输出归属
- 生成内容的归属归使用者所有
- 分发方式
- 权重在 Hugging Face;推理代码在 GitHub
- 编辑服务
- 擦除 · 局部重绘 · 外扩 · 保守/创意/快速放大 · 线稿、结构与风格控制
- 价格
- 本页不复制价格;由 Stability AI 及其云伙伴各自设定
官方文档中的使用入口
Stable Diffusion 3.5 有四条差异很大的接入路径,从自己跑权重到调用合作云服务。它们在成本与控制力上不同,但许可条款是一样的。
关于 Stable Diffusion 的高频搜索问题
Stable Diffusion 3.5 是什么?
Stable Diffusion 3.5 是 Stability AI 的开源图像模型系列,以 Large、Large Turbo 与 Medium 三种规模发布,公开了可下载的权重,并且对大多数商用场景免费。
Stable Diffusion 3.5 免费吗?
对多数使用者来说免费。Stability AI 社区许可对非商业用途免费,对年营收低于 100 万美元的组织商用也免费;超过门槛则需企业许可。Stable Image Ultra 这类托管服务另行计费,不包含在该许可内。
我能在自己的电脑上跑 Stable Diffusion 3.5 吗?
可以,权重已发布在 Hugging Face 上。官方写明 SD3.5 Medium 能在消费级硬件上开箱运行,发挥全部性能需 9.9 GB 显存(不含文本编码器);Large 与 Large Turbo 的要求更高。
SD3.5 三个版本有什么区别?
Large 是 81 亿参数的质量档,Large Turbo 是蒸馏版、约四步即可出高质量结果,Medium 是 25 亿参数、为消费级硬件设计,输出范围 0.25 至 2 百万像素。
Stable Diffusion 3.5 能渲染出可读的文字吗?
可以。官方文档称其文字质量前所未有,拼写、字距、字形与间距错误更少,并在官方示例中展示了清晰可读的字样。不过仍建议用你自己的文案实测,因为小字号是所有图像模型最终都会失手的地方。
Stable Diffusion 是开源的吗?
SD3.5 的权重是公开的,许可也允许营收门槛以下的商用。这属于「社区许可下的开放权重」,而不是无限制的开源许可;营收超过门槛的组织需要购买商业许可。
为什么同一个提示词每次出的图都不一样?
这种差异是官方明确写出的、刻意保留的设计。Stability 表示不同随机种子之间的变化能保住基础模型更广的知识面与多样风格;也因此,写得不够具体的提示词可能得到更不确定、审美更不稳定的结果。