用 Kling 3.0 直接生成。
Kling 3.0 是快手当前的视频生成模型。它是少数明确宣称原生 4K 输出的模型之一,而且声音由模型一起生成——对白、音效与环境声——覆盖五种语言,不必再走一遍配音流程。
本页能力与规格来自 Kling 官方功能页与示例区。订阅价格与额度由厂商设定,随时可能调整。
Kling 3.0 能生成什么
这些静帧来自 Kling 自己的示例区,官方给每一张配了一种商用场景:电商视频、产品展示、精品 TVC 与游戏广告素材。这组图是 Kling 主张里最实在的部分——几乎每一张都带着必须扛过渲染的文字或产品细节。
示例图版权归 Kling 所有,此处署名并链回原页: Kling AI
官方怎么描述 Kling 3.0
Kling 官方功能页把三件事放在最前面,其中音频是与大多数同类拉开差距的那一项。要选视频模型的话,下面四点最关键。
原生 4K,不是放大出来的
官方宣传原生 4K 输出,每次生成可选 720p、1080p 或 4K,播放最高 60fps。这三项都受订阅档位限制。
声音随画面一起生成
对白、音效与环境声在模型内部生成,支持英语、中文、日语、韩语与西班牙语,并提供美式、英式、印度英语等口音变体。
最多五段连镜
一条描述了多个场景的提示词,可以被组织成最多五段带转场的连贯镜头,这是官方给「手工剪一条序列」的答案。
把一致性当卖点
官方称重复出现的角色能在不同场景间保持外观、表情与动作——这恰是视频模型最常被诟病的失效点,而它的示例区就是用来反驳这一点的。
Kling 主打的能力
以下是 Kling 官方功能页自己排在最前面的几项,顺序照官方。
遵循提示词的文生视频
官方称能贴合细节描述,并让重复出现的角色跨场景保持一致,保留外观、表情与动作。
多镜头分镜
一条覆盖多个场景的提示词会变成最多五段带平滑转场的连贯镜头。
原生多语言音频
五种语言的对白、音效与环境声,带口音变体,通过提示词直接调度。
每次生成自选格式
分辨率、时长与画幅在生成时选择,而不是由模型写死:720p 至 4K、3 至 15 秒、16:9 / 9:16 / 1:1。
图生视频与图像生成
同一平台还提供图生视频、文生图、风格重绘、数字人与 Omni 模式,所以工作流可以从一张静帧起步。
Kling 公开了哪些 3.0 规格
这里只列 Kling 在自己页面上写明的数字。凡是有前提条件的,官方的前提一起保留:其中好几项取决于订阅档位。
- 开发商
- 快手
- 当前模型
- Kling 3.0(视频与图像模型同属 3.0 这一代)
- 分辨率
- 720p、1080p、4K,每次生成时可选
- 单条时长
- 3 至 15 秒
- 帧率
- 最高 60fps,取决于订阅档位
- 画幅
- 16:9、9:16、1:1
- 单次镜头数
- 最多五段带转场的连贯镜头
- 原生音频
- 英语、中文、日语、韩语、西班牙语,含口音变体
- 权重
- 未公开,仅托管可用
- 官方公布规模
- 官方称平台累计 6000 万用户、生成 6 亿条视频
大家常搜的 Kling 3.0 问题
Kling 3.0 是什么?
快手 Kling 视频模型的最新一代。官方宣传原生 4K 输出、3 至 15 秒时长、最高 60fps,以及随画面一起生成的五语言音频。
Kling 3.0 免费吗?
有免费档,但 4K、15 秒时长与 60fps 都是随订阅档位变化的,并不属于免费功能。具体限制以官方定价页为准。
Kling 3.0 会生成音频吗?
会。官方称原生支持英语、中文、日语、韩语、西班牙语的对白、音效与环境声,并提供美式、英式、印度英语等口音变体。
Kling 3.0 能生成多长?
单次 3 至 15 秒,在生成时选择。
Kling 3.0 输出什么分辨率?
官方列出 720p、1080p、4K 可选,并以原生 4K 作为卖点。能否用取决于订阅档位。
Kling 3.0 可以本地部署吗?
不行。权重没有公开,只能通过 Kling AI 官网、快手官方 API 或第三方 API 转售方使用。
一条提示词能生成多个镜头吗?
可以。官方称描述多个场景的提示词会被组织成最多五段带转场的连贯镜头,而不是一个长镜头。