Kling 生态探索原生音频、多镜头视频与动作控制探索模型

可灵 O3 — 可灵 3.0 Omni 视频模型

使用 Kling O3 创建多模态参考驱动的 AI 视频。结合原生音频、角色一致性与多镜头生成,通过参考素材引导场景和故事。

打开视频工作台
图片与视频用于展示创作方向。

可灵 3.0 Omni 视频模型

可灵 O3 具备多模态参考、原生音频、角色一致性与多镜头视频生成功能。

Kling 3.0 Omni 文生视频

文生视频使用非空的场景描述。可复用主体可由 2–4 张图片或一段角色视频定义,并可结合主体声音参考。自定义多镜头最多支持六个镜头,各自包含描述与时长;原生音频可开启或关闭。输出支持 3–15 秒及 720p、1080p 或 4K。

打开工作台

Kling 3.0 Omni 图生视频

图生视频从一张首帧图片或首尾帧图片与场景描述开始,支持主体参考、音频及最多六个自定义镜头,各自包含描述与时长。输出支持 3–15 秒及 720p、1080p 或 4K;自定义多镜头模式之外,画面比例跟随图片。

打开工作台

Kling 3.0 Omni 参考生成视频

参考生成将场景描述与支持的图片、主体参考结合,也可加入参考视频。没有视频输入时支持自定义镜头与原生音频;含参考视频时须关闭生成音频。仅视频输入沿用源视频比例,视频与图片组合使用支持的固定比例;各输入模式对参考图片及主体组合有不同限制。

打开工作台

Kling 3.0 Omni 视频转换

视频转换使用源视频与非空的场景描述,可结合支持的图片及主体参考。主体参考可使用多图、角色视频与音频。仅视频输入沿用源视频比例,视频与图片组合支持 16:9、9:16 或 1:1。该工作流有独立的声音设置,并支持 720p、1080p 和 4K 输出。

打开工作台

可灵 O3 的核心特性

可灵 3.0 Omni 视频模型

基于可灵 3.0 Omni 的多模态一体化输入

可灵 3.0 Omni 能够理解文本、图片、视频及可复用元素,并将其共同作为生成输入。可以组合不同的参考信息,在一个灵活的可灵 AI 视频工作流中引导角色、物体、场景、运动及视觉细节。

使用可灵 O3 保持角色与元素一致

可灵 O3 通过参考信息帮助保持多镜头切换与视角变化中的角色、产品、物体及场景一致性。可灵 3.0 Omni 视频模型的参考理解能力,有助于在复杂的多角色场景中保留关键视觉细节。

基于可灵 V3 Omni 视频模型的原生音频生成

可灵 V3 Omni 可生成音画同步的视频,原生音频支持在同一生成工作流中融合对话与场景音,无需将视觉和音频任务分离处理;带参考视频的参考生成须关闭生成音频。

可灵 3.0 AI 多镜头分镜

可灵 3.0 AI 可将结构化提示词转化为多镜头视频,支持自定义镜头时长、构图、机位角度、角色动作、对话及运镜,用于叙事控制与场景过渡。自定义镜头适用于文生、图生及不含参考视频的参考生成;视频转换采用独立控制项。

可灵 O3:长达15秒视频生成

可灵 O3 在文生、图生及不含参考视频的参考生成中支持单次生成长达 15 秒的视频。多镜头、一致性元素、原生音频及灵活时长控制可用于较完整的叙事序列;视频输入工作流采用独立的时长规则。

可灵 3.0 Omni 的多图参考功能

多视角图片可定义角色、产品、物体与场景,有助于保留关键细节并提升视频一致性。短视频可提供角色特征,用于新场景、动作及机位角度。声音特征可与可复用角色元素绑定,用于对白与故事叙述。角色、物品、参考图与视频可在各工作流支持的参考限制内组合。

将可灵 3.0 Omni 转化为落地的视频产品

1

创作角色一致性视频

可灵 3.0 Omni 支持角色驱动的视频,在不同场景与多镜头切换中保留角色外观,为故事叙事、虚拟数字人与品牌营销内容提供可复用角色元素。

2

借助可灵 V3 Omni 生成产品与广告视频

可灵 V3 Omni 可用于产品演示、广告投放、营销活动与社交内容,结合产品图片、场景参考、动作提示词,以及支持工作流中的原生音频,将创意素材转为营销视频。

3

借助可灵视频 3.0 Omni 模型,打造多镜头分镜叙事

可灵 Video 3.0 Omni 支持在一次生成中包含多镜头的叙事视频,可控制构图、镜头时长、对白、运镜及角色动作,实现结构化叙事。

4

使用可灵 3.0 AI 打造语音驱动的角色应用

可灵 3.0 AI 可用于对白场景、虚拟化身与虚拟角色,将角色参考、声音参考与支持生成工作流中的原生音频结合,形成可复用的角色外观与声音特征。

常见问题与解答

O3 文生、图生、参考创作与变换有何区别?

文生从提示词开始;图生从首帧或首尾帧开始;参考创作结合主体、图片或视频参考;视频变换从需要修改的已有视频开始。各工作流的素材控件不同。

O3 首尾帧图片有哪些要求?

图生接受一张首帧,或按首帧、尾帧顺序提供两张图。格式为 JPG、JPEG 或 PNG,单张不超过 50 MB,宽高均至少 300 像素,比例在 0.4–2.5 之间。

O3 可以安排多个镜头吗?

自定义多镜头最多支持六个镜头描述。自定义安排与智能镜头规划不能同时开启;总时长可选 3–15 秒,提交前核对镜头时长。

参考创作可以添加多少张图片?

没有参考视频时,图片参考与多图主体合计最多七个;混合主体类型时额度会减少。加入参考视频后,图片参考与对应主体共享最多四个位置,请按当前组合显示的计数添加。

O3 视频参考支持什么规格?

使用一段 MP4 或 MOV,时长 3–15.5 秒、最多 200 MB。宽高均为 700–4,553 像素,总像素不超过 8,294,400,比例为 0.4–2,帧率为 24–60 fps;已有作品也需符合这些限制。

为什么添加参考视频后音频不可用?

参考创作加入视频时需要关闭音频生成;文生和图生可提供音频生成。视频变换拥有独立音频设置,请核对具体工作流,不要将它们视为同一组参数。

O3 有哪些分辨率和比例可选?

O3 提供 720p、1080p 和 4K;文生支持 16:9、9:16、1:1。图生和视频工作流按素材组合与镜头模式使用自动适配或指定比例,参考素材变化后请重新核对控件。

开始使用 Kling O3 创作

使用 Kling O3 创建多模态参考驱动的 AI 视频。结合原生音频、角色一致性与多镜头生成,通过参考素材引导场景和故事。

打开视频工作台
探索全部 Kling 模型