Seedance 2.5 对提示词的响应方式跟上一代不同。落笔前有两件事要先记住:它读的是整数秒的时间戳,它也能把一段白模视频当成运镜、运动和光照的唯一来源。两条都写在官方提示词指南里。
从 2.0 到 2.5,提示词能控制的东西变了哪些
指南列了四条差异,讲的是提示词能指向什么,而不是措辞。时间戳:2.0 只响应镜头序号,2.5 响应整数秒的时间戳。多视图:2.0 不建议把多视图当主体参考,2.5 可以。宽高比:2.0 固定六档,2.5 靠控制输入素材能拿到 0.4 到 2.5 之间的任意比例。V2V 画质:2.5 的 MOV 输出在编辑与延长任务里更好地保持颜色与亮度一致。
四条里三条属于输入侧控制,规律就在这里:2.5 少猜你的意思。两代参数对照讲了这些控制背后还压着哪些限制。
时间戳:整数秒,区间要连上
官方示例里时间戳有四种写法:成对区间 0s-3s 与 3s-8s;方括号形式 [0-10秒];绑定镜头的 0-3s(首帧参考 <2pic>);以及一份镜头表,每个镜头自带一段区间。骨架长这样。
写实自然纪录片风格,电影级真实光影,温暖的午后, 在森林草坡上, 一只圆滚滚的熊猫幼崽从坡上滚下来.
0s-3s:<第一段发生什么,连同它自己的机位与光线>
3s-8s:<第二段发生什么>
<全局约束:机位高度、环境音、不要出现什么>
两个习惯从示例里读出来:区间要盖满整支片子不留空档,因为官方要求每一段各自带上画面、动作、运镜与声音;一段区间描述的是这段时间里发生什么,不是一秒里发生几次。上手教程把这些分段落到具体请求里。
白模参考:粗粒度建模,主体只留躯干
官方把白模分成两档粒度。粗粒度白模携带运动、运镜、动线和光照信息,用来锁住运动轨迹、进出画顺序、机位路径、切镜位置与光照变化,官方给它的建议是「仅用简单几何体拼接表示人物/物体/动物等」。细粒度白模则是一个完整模型结构,用来替换材质、颜色或整体风格。
有一条边界很容易漏掉,漏掉的代价是白花几次生成:白模视频主体建议仅保留躯体,避免包含【四肢/翅膀】等涉及精细运动的元素;如已包含,需补全其动作序列,以防止渲染结果出现四肢僵化。白模也可以叠加主体、场景与道具的参考图。完整原文见案例二。

宫格分镜和关键帧是两份不同的合同
两者不能互换。对多宫格,官方写的是生成画面不是严格对齐分镜图,把它定位成只提供大致的剧情参考,并建议用简约线稿分镜、让提示词补齐分镜图上没有的动作与运镜。对关键帧,官方写的是生成画面对齐关键帧,并要求第一句就写明「以图片 x 至图片 x 的顺序作为关键帧」;示例那句是「以图片 1 至图片 7 的顺序作为关键帧」,后面接一个七段式叙事。要严格对齐,宫格图是错的工具。
素材喂多少才合适
指南里有一张建议表,它的数字比任何关于「参考质量」的泛泛之谈都有用。
| 输入 | 建议 |
|---|---|
| 图片 | 最多 30 张,单张 4K 分辨率以内 |
| 视频 | 最多 10 段,总时长不超过 30 秒 |
| 音频 | 最多 10 段,总时长不超过 30 秒 |
| 主体图 | 1 到 8 个主体效果较好,9 到 12 个稳定性下降 |
| 主体音视频 | 1 到 5 个主体,每段 5 到 10 秒效果较好 |
| 多视角主体图 | 超过 5 个主体就拆成多张不同视图分别输入,别塞进一张图 |
| 宫格分镜 | 15 个分镜以内,用线稿,别在图上写太多字 |
| 白模 | 取粗粒度,用简单几何体拼接 |
| 待编辑的视频 | 20 秒以内效果较好 |
| 视频编辑的参考图 | 1 到 5 张效果较好,6 到 8 张稳定性下降 |
| 视频延长的输入与输出 | 都用 MOV,声画衔接最好 |
超出舒适区间时,官方并没有说输入会失败,只说稳定性下降、可能需要抽卡。喂更多素材也不会改变账单,因为计费走的是输出 token,计费与成本测算里有完整口径。
实例:三段官方提示词原文
案例一:8 秒熊猫,只传文本
整段分五个部分:基调、主体与场景、两段带时间戳的节拍,以及收尾那一段全局约束。参数是 duration: 8、ratio: 16:9。
写实自然纪录片风格,电影级真实光影,温暖的午后, 在森林草坡上, 一只圆滚滚的熊猫幼崽从坡上滚下来.
熊猫黑白毛发蓬松真实,体型小而胖,动作笨拙可爱。场景为绿色森林斜坡,地面覆盖青草、苔藓、三叶草、泥土、小石块、枯枝和少量小黄花,虚化背景中有高大树干与树林。镜头为低机位中远景,轻微手持感,整体基本固定,始终保持熊猫在画面中。
0s-3s:一只熊猫幼崽趴在绿色草坡上,身体圆滚滚, 它刚开始顺着斜坡慢慢侧滚,动作笨拙,草叶被身体轻轻压弯。微风拂过, 阳光从左上方穿过树林,形成斑驳光影。
3s-8s:熊猫滚到画面右下方,动作逐渐停止,从侧躺变成趴卧。它的圆脸朝向镜头,前爪压在草地上,熊猫趴在前景草丛中,身体调整到舒服的姿势,头部小幅抬起又放低, 发出轻微哼唧声。
低机位,轻微手持感,轻微跟随熊猫向右下方移动。景深自然,前景草叶轻微虚化,熊猫主体清晰,背景树林柔和虚化。自然环境音,风声、熊猫滚动时轻微柔软的扑通声, 整体温暖、真实、自然。
{
"model": "doubao-seedance-2-5-260628",
"content": [{ "type": "text", "text": "<上面的提示词原文>" }],
"ratio": "16:9",
"duration": 8
}
值得学的是最后那一段。所有对整支片子都成立的东西集中放在结尾,而不是在每段节拍里重复一遍。
案例二:白模加十张关键帧,30 秒短片
官方把一段白模视频和十张关键帧图配成一支 30 秒动画短片。第一句只给白模派一个活,随后按时间轴一段一段往下走,收尾再点明输出规格。
以白模参考视频 <video1> 作为整支视频唯一的运镜、镜头节奏、景别变化、主体运动轨迹和镜头调度参考,严格保持白模视频的镜头顺序、机位变化、运动方式和节奏,不改变镜头结构,不新增镜头,不改变主体运动逻辑。结合各阶段关键帧参考图,生成一部 30 秒电影级 3D 动画短片,整体风格梦幻、童话、温暖,具有儿童幻想色彩,角色外形与各阶段的关键帧保持一致,不要改变角色形象,人物表情情绪随场景变化而改变。
- 0-3s(首帧参考 <2pic>)镜头由全景俯视缓缓推向地上的小女孩,小女孩坐在房间的地毯上玩飞机,小女孩起身左转,右手使劲一挥将手里的飞机放飞。
- 3-5s(参考 <3pic>)飞机从左至右穿过房间悬挂的星星挂件,小女孩乘坐飞机进入幻想的天空。
- 5-8s(参考 <4pic>)镜头继续侧跟,以小女孩为中心的环绕。
- 8-10s(参考 <5pic>)镜头环绕到小女孩驾驶的飞机背面、飞机开始缓缓俯冲海面。
- 10-19s(参考 <6pic>、参考 <7pic>)小女孩继续向海底游去,一条鳐鱼游过来入画。
- 19-23s(参考 <8pic>)小女孩从时空裂缝冲出来到幻想宇宙。
- 23-24s(参考 <9pic>)前景小女孩和星球开始前翻转并,逐渐幻化消失。
- 24-28s(参考 <9pic>)俯视镜头持续推进,小女孩躺在地的毯上熟睡。
- 28-30s(参考 <10pic>)镜头继续推进绘本,随后爸爸进入画面。
整体要求:所有画面均参考对应关键帧,白模视频仅作为运镜、镜头运动和角色动画参考,不参考画面内容。最终输出 30 秒 16:9 横构图宽屏视频。
有两点值得照搬。分工写明了,白模那身灰色几何就漏不进成片;收尾那句把输出时长和宽高比也写进提示词,而请求里同样有这两个字段。
案例三:九宫格分镜加双主体
第三段在讲剧情之前先把四张图按职责绑定:image1 管整体镜头结构,image2 管环境与色彩,image3、image4 是两个角色的外观参考。之后依次是【主体设定】【整体风格】【严格排除】和九个带时间戳与台词的镜头。其中【严格排除】是大多数提示词会跳过的一节。
黑白、单色、灰度、去色;手绘、素描、线稿、插画、漫画、动画;分镜稿 / 故事板、草图;移轴微缩、玩偶感、塑料 CG、油腻过曝 CG。
它写的是要避开的画面族,不是一串词。把「不要长成什么样」说清楚,风格指令才扛得住九宫格那种信息密度。
编辑、音频编辑与延长
官方每段编辑提示词都是先固定不变的部分,再说要改的部分。最清楚的是「变老」那一段。
保留 @视频 1 的构图、机位、光线与表演节奏,只改写画面里女主的样貌与神情:让她从二十多岁自然地老去到六十岁,眼神里的隐忍慢慢化开,泪光滑过眼角,嘴角一点点扬起,最后破涕为笑。全程一镜到底,不跳切、不闪烁,五官随年龄渐变而不漂移。
约束清单本身就是提示词。翻译走同一个形状:只改人声台词、翻成中文、无字幕、口型对应改、其余不变。延长最短,官方另外注明输出格式要选 MOV。
两条请求侧规则要一起记。编辑任务的 ratio 必须为 adaptive、duration 必须为 -1,参考视频时长必须在 4 到 30 秒之间。API 接入指南讲了这几个字段在请求里的位置。
官方没有公布的部分
四处空缺在这里比平时更要紧,因为第三方指南正拿编出来的细节填它们。帧率:任何一页都没有。稳定性百分比:不存在,官方只写稳定性下降、可能需要抽卡。2K 输出档:不存在,公布的只有 480p、720p、1080p。seed 参数:官方没有公布,「固定 seed 迭代」那类建议不是字节跳动给的。
常见问题
Seedance 2.5 响应时间戳吗? 响应,精度是整数秒。按指南的差异清单,2.0 只认镜头序号。
白模参考是什么? 一段携带运动、运镜、动线、光照信息的白模视频。官方分成两档粒度,并推荐粗粒度那档。
怎么让输出严格对齐分镜图? 用关键帧参考,不要用多宫格,并把第一句写成「以图片 x 至图片 x 的顺序作为关键帧」。
一次请求最多能带多少参考素材? 50 个:30 张图、10 段视频、10 段音频,音视频各自总长不超过 30 秒。
Seedance 2.5 的提示词就是一份带角色分工的镜头表。说清每份素材管什么,给每段节拍自己的秒数,再把对整支片子都成立的约束收进结尾一段。