Seedance 2.5 一次请求能收 50 项参考素材:30 张图、10 段视频、10 段音频。总数被引用得最多,但真正决定请求能不能成的,是这套额度长什么形状——每段素材多长、哪些模态可以单独出现、哪一类根本不收。手动入口见上手教程。
50 这个数字从哪来
上限是 2.5 才有的。2.0 系列封顶 15 项,而且音频与视频共用 15 秒的总时长。
| 参考素材额度 | Seedance 2.5 | Seedance 2.0 系列 |
|---|---|---|
| 图片 | 30 张 | 9 张 |
| 视频 | 10 段 | 3 段 |
| 音频 | 10 段 | 3 段 |
| 音视频总时长 | 30 秒 | 15 秒 |
| 单次请求总项数 | 50 项 | 15 项 |
三行数字变了,输出侧没变,参考上限和 4 到 30 秒的输出区间撞成同一个数只是巧合。其余差异见参数对照。
图片:30 张,每张 4K 以内
提示词指南给出的原话是 最多 30 张 4K 分辨率以内的图片。这就是参考图全部已公布的规格:一个张数,一个分辨率上限。旁边没有任何单文件体积上限,上传校验若会拒掉一张过大的图,那是你自己的策略,不是厂商的。
同一页还有两个更软的推荐值,属于建议而不是拒绝。主体参考图 1 到 8 个主体效果较好,9 到 12 个也能试,但稳定性下降、可能需要抽卡;视频编辑的参考图 1 到 5 张较好,6 到 8 张稳定性会降。前一个数字数的是主体而不是文件,一张图里四个物体就是四个主体。
视频:10 段与 30 秒总时长
视频在两个方向上比图片更紧。最多 10 段,所有视频总时长不超过 30 秒,这是整个请求共享的额度。每段下限看任务:非编辑任务 2 到 30 秒,视频编辑任务抬到 4 秒。3 秒的视频当运动参考没问题,拿去编辑就太短了。
文件本身也有限制:宽高比 0.4 到 2.5,宽高长度 300 到 6000 像素,总像素数 407696 到 8295044,单个文件不超过 200 MB,帧率 24 到 60,容器 mp4 或 mov,出自创建任务 API 参考页。
音频:10 段,以及只给音频
音频数量与视频完全一致,10 段、总计 30 秒。差别在于 2.5 是第一代允许音频单独出现的模型。
能力表里音频参考一行在 2.5 上是支持,在 2.0 三档上都是 需搭配图片/视频,旧模型会拒掉没有配图或配视频的音频。在 2.5 上单独一段音频就是合法请求,官方写作 纯音频参考生成视频。音频有三种来源:公网 URL、形如 data:audio/wav;base64, 的 Base64 字符串、形如 asset:// 的素材 ID。条目同样需要 role 设为 reference_audio,字段位置见 API 指南。
真人人脸会被直接拒绝
这条限制会让项目停下来,而不是变慢。官方写明,2.5 与 2.0 系列模型不支持直接上传含有真人人脸的参考图或视频。同事的肖像照不是参考素材,而是被拒绝的输入。
官方留了三条路。把模型产物当作输入素材,也就是先让 Seedance 生成一张脸,再拿这个输出当参考。使用平台提供的预置虚拟人像。或者使用已授权的真人素材,asset:// 这个标识就是为这类素材准备的。
没有公布的是验证流程本身:处理时长、可接受的证件类型、哪条路一定能过,一个都没有。项目若依赖具名人物的肖像,那是写代码之前要问火山方舟的流程问题,不是参数能解决的。
示例:两段参考素材提示词
下面两段都是官方原文,可以直接贴进请求;围绕它们的参数字段写在创建任务参考页上。
示例一:一张图加六段视频
这是 2.5 教程页里的果味饼干广告。一张图以 reference_image 进入,六段视频以 reference_video 提供构图、动态与冲击感,请求里还把 omni_reference_task_type 设为 reference。
明亮多彩的广告片风格,果味饼干为主角,包含草莓、苹果、葡萄、橙子四种口味,草莓味参考@图像1,饼干与对应水果以强秩序感的几何阵列排布,整体画面干净、高级、节奏强。开场水果快速建立视觉聚焦,参考@视频1的构图,音乐重拍切入。随后不同口味饼干整齐排列,切特写,参考@视频2的动态和运镜。高潮段一块饼干被折断,瞬间进入慢动作,果味夹心爆开,碎屑飞溅,果汁感与颗粒冲击被放大展示,参考@视频3的冲击感。横向阵列,形成节奏抛物感,参考@视频4的运动,突出秩序美感与产品丰富度。随后迅速回到快节奏剪辑。结尾英文文字 One bite of crispness, a heart full of delight 快速分词切换入画,配合强节奏文字运动与产品定格,参考@视频5,最终品牌感收束,饼干和水果向四周发散,参考@视频6画面充满年轻、活力、好吃、想分享的广告氛围。
分工才是重点:一张图承担产品身份,六段视频承担镜头行为。
示例二:五张图各派一个角色
第二段提示词第一句就把方法交代完了:五张图在故事开始前各自拿到一个职责。
素材绑定:故事板分镜@图片1,卧室@图片2,李天@图片3,李倩@图片4,《快快乐乐》书籍@图片5。
镜头一:【全景固定镜头,平视三分构图】冬夜落雪房间,落地窗前,男子双手插裤兜侧立望向窗外飞雪,少女站在身侧静静看向男子,氛围安静克制,雪花持续落在玻璃窗。
镜头二:【中景过肩镜头】少女后背作为前景,男子转头温和看向少女,少女微微低头沉默,窗外落雪持续。
镜头三:【中近景,对角线构图】男子捧着书籍《快快乐乐》缓缓递出,少女抬手接过书本。
镜头四:【少女面部近景,中心构图】少女把书本抱紧在胸口,眼眶泛红,泪珠缓缓滑落,神色感伤。
镜头五:【男子面部近景,斜向构图】男子温柔浅笑,静静注视落泪少女,眼底带着怅然。
镜头六:【全景固定镜头】少女转身缓步走出画面,窗前只剩男子独自伫立,双手插兜望向漫天风雪,房间空旷寂静。
两个习惯可以搬到任何参考素材密集的请求里。给每张图按角色命名,模型就不会把五张图平均成一张模糊的合成图,参考素材互相冲突时正是这样翻车的。绑定行放最前面,模型先看到角色,再看故事。

官方没有公布什么
查阅的官方页面没有公布:参考图的单文件体积上限;与 30 张并列的图片格式清单;参考音频的体积或格式限制;任何稳定性百分比,因为官方只写 稳定性下降、可能需要抽卡;以及真人脸规则背后的身份验证流程。张数可以拿来排期,文件级的校验规则不行,把它当成你自己的策略。
常见问题
一次 Seedance 2.5 请求能放多少图、多少视频和音频? 50 项:30 张图、10 段视频、10 段音频。2.0 系列连同 fast、mini 都是 15 项。
可以只传音频,不带图片和视频吗? 在 Seedance 2.5 上可以。2.0 每一档都需要图片或视频陪着音频一起进。
能拿真人的照片当参考图吗? 不能。2.5 与 2.0 系列模型不接受含有真人人脸的参考图或视频。改用模型生成的主体、平台预置虚拟人像,或已授权的真人素材。
参考图有单文件体积上限吗? 没有公布。已公布的只有分辨率上限,每张图 4K 以内;200 MB 是参考视频那一侧的限制。
每个数字都来自厂商页面,空缺是标出来的。