PixVerse V6 和 PixVerse C1 看起来像是同一个模型被列了两遍。两者都封顶 15 秒、1080p,都支持文生视频、图生视频、首尾帧转场和参考图生视频,也都内联生成音频。在官方那张能力矩阵里,描述这两个模型的十行中有八行写法完全一样。所以规格表决定不了选型——决定选型的是你要拍什么镜头。

把官方能力矩阵逐行读一遍

官方让开发者在接入前先看这张表,它也是厂商公布过的最干净的一张对照。

能力PixVerse C1PixVerse V6旧版模型
文生视频支持支持视版本而定
图生视频支持支持视版本而定
首尾帧转场支持支持视版本而定
参考图生视频 / Fusion支持支持视版本而定
视频延长不支持支持视版本而定
内联多镜头生成靠提示词支持靠参数支持v5.5 以上
内联音频生成支持支持v5.5 以上
最长时长15 秒15 秒视版本而定
最高分辨率1080p1080p1080p
计费方式按秒按秒视版本而定

两列除两行之外完全一致。「哪个更强」因此是一道没有答案的题,「这一条镜头该用哪个」才有答案。

C1 唯一缺的那一行

视频延长只有 V6 有,这是全表唯一一处能力硬缺口:C1 标着「不支持」。这件事在镜头要越过 15 秒天花板时才有分量——V6 可以把一段片子接着往下延,而不是重开一次生成;换到 C1,就得重新生成一段再手动接上。

内联多镜头生成往另一个方向分岔,但两者都有,只是路径不同:C1 靠提示词,V6 靠参数。官方这样描述 C1 的路径:Scene segmentation is handled automatically based on prompt structure, across all major generation modes including text-to-video, image-to-video, and reference-guided workflows. 也就是说 C1 会根据提示词结构自动切镜。V6 那边,多镜头结构是你要主动设的东西。

官方给两者的定位原话

V6 被定位成通用款:Generate 15-second 1080p videos, build multi-shot scenes, add native audio, control aspect ratios, and create stronger text-to-video or image-to-video results from one creative workspace. 官方评测页给它的说法是 the widest range of everyday video tasks with strong temporal stability and native audio。两个模型要用的密钥与端点都在 PixVerse API 接入指南 里。

C1 的定位要窄得多:its first AI video model purpose-built for film production,即官方第一款为影视制作而生的视频模型。它还带一条 V6 没有的能力——分镜转视频:静态分镜版面进去,连续序列出来。官方评测页把 C1 称作 the specialist for anything involving choreography, physical interaction, visual effects, or illustrated-to-animated pipelines

API 每秒各收多少分

两个模型都按秒计费,定价页把它们并列在同一张表里,这也是唯一能把两者分开的硬数字。

画质C1 无音频C1 有音频V6 无音频V6 有音频
360p6857
540p81079
720p1013912
1080p19241823

单位为每秒消耗的积分,取自官方定价页。无音频时 C1 每一档都比 V6 贵 1 分;带音频时在 360p、540p、720p 三档同样贵 1 分。有一条脚注会把这个结论翻过来:当 Fusion(参考图生视频)带视频参考时,V6 在 1080p 最高可到每秒 36 分与 46 分。官方没有印出「一条成品片总共多少分」的价格,那是乘法;PixVerse 积分与价格指南 把每秒单价能算成什么讲了一遍。

同一个需求的两种示例

同一个思路——一个主体、一次运镜、带声音——分别推给两个模型。

PixVerse C1 官方分镜静帧:编号画面从林间女孩与发光蝴蝶,到她的面部与靴子特写,再到小径与女孩远去的全身镜头
PixVerse

示例一:用 V6 做产品预告

下面这段提示词是官方 V6 产品页上的文生视频示例原文,参数是那一页让你在生成前设定的。

Prompt: A matte black smart speaker sits on a walnut desk at sunrise. The camera slowly pushes in from the left. Warm light reflects on the metal rim. A soft startup chime plays as the LED ring turns blue.
model: v6
quality: 1080p
duration: 15s
generate_audio_switch: true

静止的产品、缓慢的推镜、卡在画面节拍上的音效,这是一眼该交给 V6 的活。1080p 带音频这一档,表上 V6 是每秒 23 分,跑满 15 秒大约 345 分——这是按官方表做的乘法,不是官方印出来的总价。

示例二:用 C1 拍动作戏

这是官方 C1 评测页里的战斗测试,走图生视频,输入是一张参考帧。

Prompt: Rain-soaked street brawl, fists connecting with impact.
Input: a reference frame of two fighters in a rain-soaked street
model: c1
quality: 720p
duration: 10s
generate_audio_switch: false

官方报告的结果是一条 10 秒片,the two characters exchanged close-range strikes in the rain;它点名了站得住的那处细节——拳头打到下巴时,the recipient's head snapped back at a speed that matched the force of the swing. Raindrops scattered off the impact point. 同一页也如实写了失误:occasionally a foot slides on the wet surface in a way that ignores friction。720p 无音频这一档 C1 是每秒 10 分,10 秒约 100 分。

两次之间变的不是规格,也不是价格。变的是一个需求要的是卡点的音效和干净的主体画面,另一个需求要的是接触物理。

按交付物选,不按参数表选

官方评测页把这件事压成一句值得记住的话:if the main deliverable is a file, choose V6 or C1 first.

  • 要能反复出货的商业内容——V6。 产品预告、广告钩子、同一条提示词切多个画幅的社交素材,今天就要交、交出去就得像成品的那种。
  • 编排、接触、粒子、特效素材——C1。 打斗、变身、元素特效,以及需要把分镜版面直接变成序列、不想逐镜写提示词的项目。
  • 需要接着往下延的镜头——V6。 视频延长是 C1 唯一整行输掉的能力。
  • 要让观众边看边改的东西——两个都不行。 那是 PixVerse R1,什么时候实时会话比渲染好的文件更划算,看 PixVerse R1 指南

两者共同的天花板

共同上限是 15 秒与 1080p,而且在我们能打开的官方页面上,两个模型的帧率都没有公布。此外两者各有各的失败方式,官方自己也写了。

C1 列了三个可预期的问题:快速动作里脚步在湿地面上打滑;提示词过长,very long choreography instructions may cause the model to prioritize some beats and ignore others. Shorter prompts with one clear action usually worked better.;以及分镜歧义,panels with similar compositions can confuse shot segmentation.

V6 没有对应的清单,但它的 FAQ 把问题回答掉了:AI video outputs can vary when prompts are vague, identity anchors are missing, or the requested scene includes too many competing actions. 两个模型的解法一样——描述写实、每条镜头只留一个明确动作。如果你还在熟悉这个工具,PixVerse 上手教程 会先带你过一遍设置界面,那时候还不用选模型。

常见问题

PixVerse C1 比 V6 更好吗? 笼统地说不是。官方能力矩阵十行里它们有八行相同。C1 面向动作、特效与分镜驱动的工作,V6 是通用款,也是两者中唯一支持视频延长的那个。

做产品视频该用哪个模型? V6。它的产品页面向的就是产品预告、广告与社交短片,而且在每一档分辨率与音频设置下,它每秒都比 C1 便宜。

PixVerse C1 支持视频延长吗? 不支持。能力矩阵里这一行 C1 是「不支持」、V6 是「支持」,所以需要越过 15 秒往下接的镜头应该交给 V6。

两个模型每秒各多少分? 无音频时 C1 在 360p、540p、720p、1080p 分别是 6、8、10、19 分,V6 是 5、7、9、18 分。带音频按分辨率再加 2 到 5 分。

先想清楚要交什么,再挑对得上的模型,最后才去读参数表。