两代模型,同一个厂商,三条会动的限制。两条往上走,第三条横着走——方向恰好跟「新一代一定更大」这个直觉相反。

Seedance 2.0 到 2.5 到底改了什么

ByteDance 把两代放在火山方舟文档的同一张能力矩阵里,那也是唯一让这些数字并排出现的地方。读下来升级故事很短:单次生成更长、参考素材更多、多了一个输出封装。分辨率那一列不跟着这个规律走,所以它在下面一直留着,不做平滑处理。本文所有数字都来自 ByteDance 或火山引擎自己发布的页面,Seedance 主题页会跟着模型线一起更新。

参数表,只放官方自己列的行

2.0 那一列覆盖整个 2.0 系列,因为 2.0、2.0 fast 与 2.0 mini 除表下那条注记之外共用同一组值。

参数Seedance 2.5Seedance 2.0 系列
模型 IDdoubao-seedance-2-5-260628doubao-seedance-2-0-260128
单次生成时长4~30 秒,或填 -1 由模型自选4~15 秒,或填 -1 由模型自选
单次参考素材上限50 个:30 张图、10 段视频、10 段音频15 个:9 张图、3 段视频、3 段音频
输出分辨率480p(8bit)、720p(8bit)、1080p(10bit)480p(8bit)、720p(8bit)、1080p(8bit)、4k(10bit)
音频参考可单独传入需搭配图片或视频
输出格式mp4、movmp4
输出宽高比21:9、16:9、4:3、1:1、3:4、9:16、adaptive同样这七个取值
样片模式、离线推理均不支持均不支持

2.0 系列里更小的 fast 与 mini,分辨率只剩 480p 和 720p。

时长:从 15 秒到 30 秒

官方更新说明只用一行写这件事:视频生成时长上限从 15 秒延长到 30 秒。能力矩阵把同一个限制放进单元格,2.5 是 4~30 秒,2.0 系列是 4~15 秒,两边都有一个 -1,把时长选择权交回给模型。

有两个细节容易在转述里丢掉。下限是 4 秒,所以两秒的插入镜头在两代身上都超出官方区间。上限是「单次」的:英文项目页补了一句,2.5 的片段可以延长两次,几分钟的连续素材就是这样拼出来的;中文公告写的是「支持多轮延长」,没给轮数。Seedance API 接入指南讲了这些追加调用背后的任务生命周期。

参考素材:从 15 个到 50 个

单次 50 个:30 张图、10 段视频、10 段音频。2.0 系列停在 15 个:9、3、3。更新说明把这个跳变拆成三行:参考图上限从 9 张增至 30 张,参考音/视频数量上限从 3 个增至 10 个,参考音/视频总时长从 15 秒增至 30 秒。

方舟文档公布的参考输入图,是喂给 Seedance 2.5 的静态素材而不是模型输出
ByteDance

有一项能力是新增的,而不只是变大:2.5 能单独传音频参考,请求里可以只有一段配乐或一段人声,不带任何图片和视频。2.0 系列在能力矩阵里被标注为「需搭配图片/视频」。

分辨率:老一代留着的那一档

就是这一行最容易把人绊倒。Seedance 2.5 提供 480p、720p、1080p。2.0 系列提供这三档之外,还有 4k。这就是「4k 还是 1080p」的完整答案:4k 属于 2.0,当前这一代的上限是 1080p。

也没有 2K 档可以退。如果一份对照表给 Seedance 2.5 标了 2K 或 4k 输出,厂商的能力矩阵里没有这一项。2.5 在同一档里确实改了位深:它的 1080p 是 10bit,而 2.0 的 1080p 是 8bit。封装也不同:2.5 输出 mp4 或 mov,2.0 系列输出 mp4,官方对 mov 的解释是 H.264 视频编码、yuv444p 色度采样加 PCM 音频编码。

实例:同一句提示词,两个模型 ID

两句官方发布过的提示词,各跑两代。

案例一:一句 30 秒叙事提示词

发布公告把一段文生视频提示词和它的输出片段成对给出。提示词开头是 一镜到底手持稳定器跟拍,镜头从红色厚重幕布缝隙缓缓推进,进入暖色后台化妆间,结尾是 镜头最终拉远至体育馆全景,呈现满场观众。这是一个歌手从后台走到舞台的一镜到底,交给 Seedance 2.5 时参数是这样:

{
  "model": "doubao-seedance-2-5-260628",
  "content": [{ "type": "text", "text": "<上面的提示词原文>" }],
  "ratio": "16:9",
  "duration": 30,
  "generate_audio": true
}

ByteDance 对结果的描述只有一句:模型把歌手在化妆间与工作人员互动、穿过后台走廊、与伴舞相遇再一起登台演出的完整故事演了出来,而不是只给一个歌手上台的画面。现在改一个字段。把这句提示词指到 doubao-seedance-2-0-260128duration 仍填 30,这个值就落在官方 4~15 秒 区间之外,同一段文字必须拆成两次十五秒以内的请求,接口处的衔接成了你自己的事。

案例二:一句要十八张参考图的提示词

第二句官方提示词是音乐会场景,参考素材直接写在提示词里:场景@图一,钢琴家参考@图二,大提琴参考@图三,小提琴参考@图四,主唱参考@图五,管弦等其他乐队参考@图六到图十,合唱团参考图十一到图十四,观众席参考@图十五到图十八。十八张图,一次请求。在 Seedance 2.5 上,它放进 30 张图的额度里还有富余,官方对输出的描述是模型能同时还原多个人物的形象与声音,并在群像画面里保持各主体稳定。把同一句提示词搬到 2.0 系列的模型上,图片上限是 9 张,一半的参考得删掉。

该选哪一代

按你真正会撞上的那条限制来选。叙事类创作、片段偏长的,需要 2.5,两代里只有它把 30 秒写在单次生成里。场景靠一堆参考主体撑起来、或者依赖一段配乐的,也需要 2.5,因为它有更大的额度,还多了一条纯音频参考的路径,上手教程里有具体走法。需要 4k 输出的,能列出来的反而是老一代,新旧不能改变这件事。只有纯文本短片段时,两代是重合的:同一组宽高比取值,同样的样片模式与离线推理限制,差别收窄到时长和参考容量两项。

官方没有公布的部分

三处空缺值得点名,而不是填空。能力矩阵里没有帧率,本文查过的页面也都没写,所以上面一个数字都不给。参考视频的入参约束写在官方另一页《创建视频生成任务》上,要看得去那一页。两代之间的性能差没有公布过:2.0 项目页展示了厂商自研基准的成绩,2.5 项目页没有这一节,两页也都没有给出任何对比百分比。

常见问题

单次能生成多长? Seedance 2.5 是 4 到 30 秒,填 -1 由模型在区间内自选。2.0 系列停在 15 秒。

各自能吃多少参考素材? 2.5 是 50 个:30 张图、10 段视频、10 段音频。2.0 系列是 15 个:9、3、3。

Seedance 2.5 能输出 4k 吗? 不能。它公布的档位是 480p、720p、1080p。4k 档属于 2.0 系列。

可以只传音频、不配图片或视频吗? Seedance 2.5 可以。2.0 系列的音频参考必须搭配图片或视频。

三条限制,两个方向:新一代更长、更吃参考素材,而上限最高的一档仍在老一代手里。