Veo 3.1 和 Runway Gen-4 被拿来对比时,比的通常是感觉,而不是纸面。可这两家都真的印了纸面,而且两张规格页回答的是不同的问题:一张说一个镜头里能装下什么,另一张说一次生成多少钱。

下面每个数字都印在厂商自己的页面上。某一侧根本没有这一行,我们就写「未公布」,不从测评站搬一个数字过来补位。

短答:八秒带声音,或者十秒不带

Veo 3.1 的官方口径是每个片段八秒,1080p 与 4K,对白、音效和环境底噪都与画面一起生成。Runway Gen-4 的官方口径是每次生成五秒或十秒,六种大约一百万像素级别的输出尺寸,必须提供一张输入图,而它的规格表里没有音频这一行。

如果你的需求是有人在镜头前说话,先由音频这一行决定,接下来才轮到画质。如果你的需求是从一张定死的静帧里拉出一段长运动,决定权在时长那一行。

两家官方页面各自印了什么

公布项Veo 3.1 · GoogleRunway Gen-4 · Runway
印在哪一页DeepMind 的 Veo 模型页Gen-4 帮助中心文章,加上 API 文档
片段长度「Veo videos are 8 seconds long.」五秒或十秒
分辨率1080p 与 4K六种尺寸,含 16:9 的 1280x720
帧率未公布24fps
音频是否随片「generating all audio natively」Gen-4 规格表里没有这一项
文生视频有文档两个 Gen-4 模型都要求输入图
角色参考参考图、首尾帧「a single reference image」
公布价模型页上没有每秒 12 积分,套餐从 $0 起
标记方式生成视频带 SynthID 标记Standard 套餐写「No watermarks」

有两行是故意空的。Google 没印帧率,Runway 的 Gen-4 规格表没印音频。两个空缺都不是缺陷,只是没写。

时长与分辨率:两张纸,两种形状

Google 只印一个长度,「Veo videos are 8 seconds long.」,然后给出绕开它的办法。官方博客说,用 Extend 可以「create longer videos, even lasting for a minute or more」,每一段都从上一段的最后一秒接着生成。

Runway 印了两个选项:「Gen-4 creates videos in 5 or 10 second durations based on an input image and text prompt you provide.」帮助中心还解释了怎么选:简单动作适合五秒,要求多个动作的提示词适合十秒。

分辨率上的分歧更大。Google 印的是「Generate outputs in 1080p and 4K」。Runway 的 Gen-4 规格表印了六种尺寸,从 16:9 的 1280x720 到 21:9 的 1584x672,全部落在一百万像素上下,帧率 24fps。你会看到有人把 Gen-4 写成 4K 模型。在 Runway 自己的页面上,4K 是某个套餐的放大(upscaling)权益,不是 Gen-4 的输出尺寸。

音频:决定大多数需求的一行

Google 官方 Veo 3.1 示例拼图,画面里有摄影棚中的舞者、原野上策马的人等多个官方示例镜头的缩略画面
Google

Google 在这个问题上说得很直白:Veo 会加入音效、环境底噪甚至对白,而且是「generating all audio natively」。Gen-4 的规格表里压根没有音频字段,Runway 的开发者文档把音频放在另外几个模型下面,各有各的费率。所以准确的说法不是「Runway 做不了声音」,而是:在那边声音是第二次购买、第二个步骤,在这里它和画面属于同一次生成。

Runway 自己给 Veo 3.1 印的费率表

这一条几乎没有对比页提过。Runway 的 API 文档把 Veo 3.1 列为可以通过 Runway 调用的模型,而且公布了每秒费率。

Runway API 上的模型含音频不含音频
veo3.140 credits per second20 credits per second
veo3.1_fast15 credits per second10 credits per second

Runway 写明积分按每个一美分购买,照它自己的费率算下来,带音频调用 Veo 3.1 是每秒 0.40 美元。这是 Runway 转售这个模型的报价,不是 Google 的定价,而 Google 自己一个每秒数字都没公布。

一条片子多少钱,以及那是谁的数字

Google 的 Veo 页面没有价格、没有档位、没有积分余额、也没有免费额度。Runway 四样都公布了:免费档给一次性 125 积分,然后是年付的 Standard 每月 12 美元、Pro 每月 28 美元、Max 每月 76 美元。

要按秒算价,请用 API 费率表,别用套餐页:套餐页把积分折算成视频秒数,而它自己那几行在 Gen-4 Turbo 上就对不齐。费率表给的是每秒一个数字——Gen-4 每秒 12 积分,Gen-4 Turbo 每秒 5 积分。Veo 3.1 这边 Google 没有任何可比数字,这也是价格与免费额度指南拒绝把 Veo 的积分余额换算成条数的原因。

案例:同一个拍子交给两家

需求是这样的:一个人,一句台词,镜头不动,八秒画面。先写 Veo 3.1,因为在那边音频这一行让它变成一步就能完成的事。

案例一:Veo 3.1 的一条带对白镜头

景别与运动:中景,固定机位,机位在眼睛高度
风格:纪实自然主义,35mm,浅景深
光线:左侧柔和窗光,不加补光
角色:三十多岁的女性,深色卷发,绿色工作围裙
地点:一家小面包房的柜台,身后是成盘的面包
动作:她擦完台面,抬头对着镜头说了一句话,然后继续干活
对白:「We sold out by nine. That has never happened.」
音频:安静的后厨底噪,一个托盘放到金属台面上,不加音乐

参数:一次生成,1080p 或 4K,原生音频打开。生成回来要看两件事。台词有没有整句落地——Google 自己写明,生成自然且连贯的口语语音,尤其是较短的片段,仍是持续开发中的领域。还有托盘声有没有落在托盘上,提示词指南把这件事写成「让音频与画面匹配」。

案例二:同一个拍子交给 Gen-4

Gen-4 从一张静帧出发,所以同一个拍子拆成两个决定。先准备输入图:同一位女性、同一个柜台、左侧来光、16:9 构图。Runway 的文章写得很明确,这张图「acts as the first frame of your output video」,而提示词「should be almost entirely focused on describing the desired motion」。

她用右手缓慢地擦两次台面,把抹布放下,直起身体。她看向镜头,停一拍,
然后转身朝向身后的面包盘。镜头保持不动。画面里不要出现其他人。

参数:时长五秒,16:9 的 1280x720,24fps,按公布的费率是 60 积分。台词挪到后期,那边的声音是单独售卖的。想把说话这一半写细一点,对白与音效指南接着往下讲。

我们没有把这两条并排跑过,这篇也不是画质评判。它写的是两家的官方文档说这些输入会得到什么。

第三方的数字是从哪来的

搜这个对比,你会反复撞见三种偏差。Gen-4 被写成 1080p 甚至原生 4K,而 Runway 自己的规格表停在一百万像素上下。Veo 3.1 被配上一份时长菜单,而 Google 只印了八秒,更长的部分交给 Extend。两款模型还会被配上没有主的每秒价格,其中一部分是某个托管平台自己的费率。Veo 3.1 与可灵 3.0 对比对一家真的印了完整费率表的厂商做过同样的拆分。

两家都没有公布的部分

Google 的 Veo 3.1 页面没有价格、没有档位、没有积分换算、没有免费额度、没有对白语言清单,也没有可见水印政策,只说了输出会带 SynthID 标记。Runway 的 Gen-4 页面没有写这个模型支持音频,也没有 Gen-4 的专业交付格式——那些是为 Gen-4.5 和 Aleph 2.0 写的。

两家也都没有发布联合基准。各自的页面上摆的都是自家的内部对比,那是厂商在测自己。

常见问题

哪一款能做出更长的片段? 按公布的数字是 Gen-4:五秒或十秒,对固定的八秒。Google 为更长内容提供了 Extend,可以到一分钟以上。

Gen-4 会生成音频吗? 它的规格表里没有音频这一行。Runway 的声音由另外的模型提供,单独计费。

哪一款更便宜? 没有统一答案。Google 没有公布 Veo 3.1 的价格;Runway 既公布了套餐表,也在自己的 API 上给同一个模型公布了每秒费率。

可以在同一个地方调用两款吗? Runway 的 API 文档里同时列着 Gen-4.5、Gen-4 Turbo 和 Veo 3.1,所以这件事并不总是二选一。API 与 Vertex AI 价格指南写的是走开发者路线接入 Veo 的入口。

两张规格页,两份不同的工作。按真正决定你需求的那两行来选——音频和时长——其余的价格请查厂商自己的费率表,而不是查对比表。