Google 的提示词指南给音频留了一段技巧,给对白留了一个编号要素。往 Veo 3.1 的提示词里塞声音,官方的全部家底就这么多,而多数教程直接从旁边绕过去了。
下面所有内容出自三个页面:那份提示词指南、Veo 模型页、Flow 的那篇公告。你在别处读到、而这三页上没有的规矩,本文会直接说没有,不会替你复述。
Google 关于音频到底公布了什么
三页各说一层。提示词指南承载方法:一段叫「融合画面与声音设计」的技巧,外加把对白列为七个要素之一。模型页承载能力声明和那句诚实的限制。Flow 公告承载音频现在覆盖到哪:「For the first time, we’re also bringing audio to existing capabilities like ‘Ingredients to Video,’ ‘Frames to Video’ and ‘Extend.’」
能力那句在模型页上:Veo 会加入音效、环境底噪甚至对白,而且是「generating all audio natively」。没有菜单,没有参数,没有开关。提示词指南讲的则是这三种能力要写进什么结构里。
对白是要素,音频是技巧
指南按顺序点名七个要素:景别与运动、风格、光线、角色描述、地点、动作、对白。音频不是第八个,它单独占一段技巧。这件事本身透露了模型的调教方向:说话是你摆进去的指令,底噪是你描述出来的质感。
对白这一条只有两句话,两句都重要:
「Veo 3 can generate dialogue. You can either pick a topic for characters to talk about, or give characters specific things to say.」
给话题写起来短,措辞交给模型。给确切的词,你拿到了控制权,同时也决定了这句台词要占多少画面时间。在八秒一条的片子里,通常就是这一条在起决定作用。
角色那一条里藏着一句更安静的规矩。指南要求写出「specific and detailed descriptions about each character’s appearance, voice, action, and dialogue」——声音属于角色描述,不属于结尾那个独立的音频块。
官方给出的那一小段音频,逐句拆开
指南页上音频示例只有一个,它的形状值得照抄。
A keyboard whose keys are made of different types of candy. Typing makes sweet,
crunchy sounds. Audio: Crunchy, sugary typing sounds, delighted giggles.
看看它在做什么。画面那一句排在最前面,并且里面装着发声的动作——打字。接着是独立的音频段,点名两种质感和一个人声反应。它不描述混音,它定义这条片子里应该有哪些声音。
Google 围绕它给的指令只有一句:把你想听到的声音明确写出来,让音频和画面对得上。
案例:两段提示词,一段带对白,一段只有音效

两个案例都按八秒写,因为模型页只印了一个长度:「Veo videos are 8 seconds long.」
案例一:八秒里塞两句台词
景别与运动:中景,固定机位,轻微定格动画的顿挫感
风格:定格动画,手工搭建布景,能看到黏土接缝
光线:上方一盏暖色台灯
角色:穿红色冲锋衣的徒步者,三十多岁,走路带定格动画的顿挫
地点:黄昏的林间空地,毛毡树,棉花做的雾
动作:徒步者把小旗子插进苔藓,转身面向镜头
对白:Hiker: "This is my spot now." Ranger: "The bear disagrees."
音频:安静的森林底噪,旗杆插进松软泥土,远处一声猫头鹰
两个说话人都写在台词前面,这正是 Google 自己那条定格动画示例的结构。真正的约束在第二句台词:模型页写明,生成自然且连贯的口语语音、尤其是较短的片段,仍是持续开发中的领域。再加一轮对话,这段话就不是变清楚,而是开始掉字。
案例二:只有音效,一句对白都不要
景别与运动:特写,固定机位,轻微手持晃动
风格:纪实产品素材,50mm
光线:右侧硬光,身后深阴影
角色:只出现两只手,不入画脸
地点:不锈钢操作台
动作:罐盖被拧动、松开,盖子被放到钢面上
对白:无
音频:橡胶密封圈崩开一声,金属盖碰钢面一次,后面是安静的厨房
那句明确的「对白:无」是有用的。指南的指令是把想要的声音定义出来,所以「这里没有说话」也值得写下来,而不是交给运气。
这两个案例我们没有拿去做监听室核对,也不附带任何效果承诺。上面写的是每一行在官方文档里对准的是哪条能力。
写在行内还是单独一段:两种都有文档
指南用一句话结掉这个问题:音频提示可以整合进提示词,也可以放在单独一段里。糖果键盘那个示例用的是单独一段;指南里那条越野拉力赛的长提示词反着来,把引擎轰鸣和泥水飞溅写在散文式提示词中间。
下面这个排版,是用指南自己的要素名拼出来的。它是可以照着写的结构,不是 Google 公布的模板:
景别与运动:……
风格:…… / 光线:……
角色:……
地点:……
动作:……
对白:……
音频:……
官方的连贯性事实只公布了一条,而它直接决定一组片子的音频怎么写。Extend 生成的每一段视频,都基于上一段的最后一秒。上一段结尾如果有一记巨响,它会影响后面接出来的东西——一段场景的音频连贯性,是上一段的结尾决定的。
声音不对的时候
三种情况覆盖了大部分。完全没声音,通常是提示词只描述了画面,这正是那段声音设计技巧要解决的问题。台词被截断或含混,撞上的是官方写明的短片段限制,这时把确切的词改成话题,要求就降下来了。音效来得晚、或者落在错的物件上,通常是因为只描述了声音、没有把它挂在看得见的动作上——而两个官方示例都做了这件事。
第三方在教、而 Google 没有公布的写法
方括号标签(比如 [SFX: ...])、48kHz 采样率、八秒内的字数上限、毫秒级对嘴偏移、音量数值、负面音频提示词——这些都在以规格的口吻流传。提示词指南、模型页、Flow 公告,三页上一条都没有。它们可能是一套能用的个人习惯,本文也不对它们下判断。这里只想说清一件更窄的事:Google 没有公布过。
音乐值得同样的小心。官方三页点名的是音效、环境底噪和对白。音乐不在七个要素里,也没有被写成一种能力。任何教你写音乐字段的教程,教的是作者自己的简写。
Google 关于音频没有公布的部分
没有采样率或声道布局。没有每条片子的字数或台词数上限。没有对白语言清单。没有负面音频语法。没有音量控制。没有音乐要素。也没有关掉音频生成的公开开关。
与之相对,有一句限制写得很直白,而它恰恰是多数音频教程跳过的。模型页写明:生成自然且连贯的口语语音,尤其是较短的片段,仍是持续开发中的领域。另一边公布了什么,包括把 Veo 3.1 挂在别家 API 上按秒计费的价格,Runway Gen-4 对比里有。
常见问题
Veo 3.1 能生成对白吗? 能。指南写明模型可以生成对白,而且你可以给角色一个话题,也可以给它确切的词。
音频写在提示词的哪里? 两种位置都有文档:音频提示可以写在提示词里,也可以单独成段。官方那个示例用的是单独成段。
可以让它配乐吗? Google 那三页点的是音效、环境底噪和对白,音乐不在其中。所以配乐提示词按「官方未公布」对待。
一条片子里能装几句台词? Google 没有公布字数或句数上限。唯一的公布长度是八秒,而较短片段的口语语音被标为开发中。上手教程把第一条片子从头走一遍,API 与价格指南讲的是音频按秒计费的那条路。
先把画面写完,给说话单独一行,把真要听的声音点名。要素是公布的,其余的是你的手感。