快速答案
在这轮小样本里,Kling 3.0 和 Kling O3 都能完成文生视频与图生视频任务,但动作侧重点不一样。纸船测试中,两边都生成了红色纸船、雨滴涟漪和缓慢推进的镜头。Kling 3.0 的推进感更明显;O3 更早出现涟漪,镜头节奏也更平稳。猫咪首帧测试中,两边都保住了主体外观。O3 更清楚地做出了指定的眨眼,Kling 3.0 则把抬爪动作做得更大,靠近镜头的爪子也更容易出现运动模糊。
更明显的差别在工作流。只有 Prompt 或首帧图时,Kling 3.0 的入口很直接。O3 同样支持这两种起点,还能通过 Reference to Video 使用参考视频。Kling 3.0 Motion Control 则要求同时提供角色图片和动作视频。我们使用同一组公开素材测试时,O3 参考视频任务完成了;Kling 3.0 Motion Control 两次都在图片处理阶段停止。这个结果只说明本次输入与路由的兼容性,不代表 O3 的动作质量整体更好。
这不是跑分。直接对照一共包含 4 个完成输出:文生视频各 1 个,图生视频各 1 个。我们还做了一组同素材的参考视频工作流核验。所有完成的对照视频都是 5 秒、720p、关闭声音,由一名审阅者在 2026 年 8 月 4 日检查文件信息与接触表。

画面质量只比较完成的同输入样本。参考视频这一行记录的是路由可用性和设置结果,因为 Kling 3.0 没有返回可评分的视频。
三种名称分别指什么
这组名称容易混。Kling 官方把参考驱动的模型叫做 VIDEO 3.0 Omni。EvoLink 把这组能力做成 Kling O3 路由,包括文生视频、图生视频和参考视频。KlingVideo 生成器里显示的名称也是 Kling O3。标准模型则显示为 Kling 3.0,底层使用 kling-v3-* 路由。
本文比较的是 KlingVideo 当前界面名称背后的实际工作流,不覆盖 Kling 官方应用里的所有功能,也不假设某个提供商路由等于底层模型的全部能力。
想先看完整功能范围,可以读 Kling O3(3.0 Omni)功能指南。Kling 3.0 模型页列出了标准模型当前可用的控件。
测试方法与输入
我们按三个常见起点来测,因为选择模型通常取决于你手里已经有什么:只有 Prompt、一张图片,还是一段参考视频。
| 测试 | 相同输入与设置 | Kling 3.0 路由 | O3 路由 | 对照状态 |
|---|---|---|---|---|
| 文生视频 | 相同纸船 Prompt,5 秒,16:9,720p,关闭声音 | Text to Video | Text to Video | 2 个完成输出 |
| 图生视频 | 相同猫咪图片与动作 Prompt,5 秒,720p,关闭声音 | Image to Video | Image to Video | 2 个完成输出 |
| 参考视频 | 相同猫咪图片、猫咪动作视频与意图,720p,关闭声音 | Motion Control | Reference to Video | O3 完成;Kling 3.0 两次停在图片处理 |
文生视频 Prompt 要求一只小红纸船从左向右漂过浅水坑,一滴雨落在旁边形成圆形涟漪,镜头低机位缓慢向前推进,同时保持纸船居中。画面要有真实水面,不要人物和文字。图生视频从一张竖版奶油白猫照片开始,要求猫慢慢抬起左前爪、眨眼一次,再看向镜头,同时保留脸部花纹、眼睛、毛色、爪子、周围的手和固定机位。
参考视频核验中,两条路由收到同一张公开猫咪图和同一段 5 秒猫咪动作视频。两者的接口逻辑并不相同。O3 Reference to Video 把视频当作特征参考,还可以结合图片;Kling 3.0 Motion Control 用图片提供外观,用视频提供动作轨迹。这种差异本来就是工作流的一部分,也意味着一侧没有出片时,不能把这一行当成纯画质 A/B。
我们检查 4 个维度:指令跟随、主体与形状一致性、镜头或动作控制、迭代成本。这里的“迭代成本”指设置摩擦和再次生成的概率。没有做盲测,没有逐帧量化,没有测试声音,也没有在受控网络下比较耗时,更没有计算统计成功率。
文生视频同输入结果
两边都理解了场景。画面里都有一只红色纸船和带倒影的雨水。纸船发生位移,镜头逐渐靠近,也出现了圆形涟漪,没有多出人物或可见文字。5 张接触表采样中,两边都没有明显的主体崩坏。
Kling 3.0 的推进更容易看出来。从开场到结尾,纸船尺寸增加得更明显,较晚出现的涟漪也形成了一个清楚的收尾节拍。O3 的变化更克制,涟漪出现得更早,纸船在采样帧里的尺寸变化较小。两种结果都说得通,但放进剪辑时,节奏用途不一样。
这一组不能支持通用的“谁更听话”分数。更实际的结论是:即使场景内容都正确,同一条运镜指令也会被不同程度地强调。如果涟漪时间点或推进强度很重要,要把时间写得更具体,并预留多个候选结果。
图生视频同输入结果
首帧组更容易判断,因为两条视频从同一张猫咪照片开始。两边都保住了奶油白的脸、深色眼睛、胸前毛发、附近的手和竖版构图,也都没有擅自重建房间或换掉整个场景。
O3 对“眨眼一次”的执行更直接。接触表里有一帧可以清楚看到双眼闭合,随后又看向前方。抬起的爪子在整个动作中仍能认出来,不过快速靠近前景时,边缘也会变软。
Kling 3.0 把抬爪做得更大、更有冲击力。猫脸一直可辨认,但爪子占据的画面更大,模糊也更重。采样帧里无法确认一个清楚、独立的眨眼。如果成片需要固定顺序的小动作,这一组里 O3 更接近 Prompt;如果需要更明显的前景动作,Kling 3.0 的结果反而更好用。

每种模式、每个模型只有 1 个完成输出。这里描述的是样本,不是模型长期胜率。
Motion Control 与参考视频可用性
参考视频是两套工作流差异最大的地方。
O3 Reference to Video 可以接收视频参考,也能结合图片或 Element。使用同一张猫咪图与同一段猫咪动作视频时,任务通过输入处理并正常完成。输出跟随了参考视频里的直立抬爪动作和明亮房间构图,也保留了奶油白猫的大体特征,但脸部与毛色细节发生变化,原图中的手和沙发被替换。这更像特征参考生成,而不是直接编辑原视频。
Kling 3.0 Motion Control 的要求更具体:一张参考图片提供角色或物体外观,一段参考视频提供动作轨迹。我们测试了两次,两次都在 10% 报图片处理错误。相同公开图片在图生视频和 O3 参考任务里可以使用,因此这轮没有可评分的 Kling 3.0 Motion Control 输出。
能下的结论很窄:对这组输入来说,O3 从参考素材到完成视频的路径更短。准备批量使用 Kling 3.0 Motion Control 时,要先做一次图片与视频兼容性检查。它仍可能适合明确的动作迁移任务,但不能跳过单样本验证。Kling AI Motion Control 排错指南整理了常见的输入、构图和主体问题。
结果矩阵
| 维度 | 本次 Kling 3.0 | 本次 O3 |
|---|---|---|
| 文生视频指令跟随 | 场景、位移、涟漪和推进都出现 | 场景、位移、涟漪和推进都出现 |
| 图生视频指令跟随 | 抬爪明显;采样帧无法确认指定眨眼 | 抬爪之外,还能清楚看到眨眼 |
| 主体一致性 | 纸船和猫都可辨认;爪子靠近镜头时模糊更重 | 纸船和猫都可辨认;前景爪子运动时也会变软 |
| 镜头与动作侧重 | 推进更明显,前景动作更大 | 文生镜头更平稳,小动作顺序更贴 Prompt |
| 参考视频工作流 | 需要图片加动作视频;本次输入两次处理失败 | 相同素材通过处理并返回视频 |
| 这组证据更适合的解读 | 需要更明显动作的 Prompt 或首帧任务 | 需要按顺序执行小动作,或从参考素材开始探索 |
这张表刻意只写观察。一个输出能暴露失败模式或工作流限制,却不能建立稳定排名。换一个主体、时长、比例或 Prompt,结果完全可能反过来。
应该从哪个模型开始

只有文字场景、又希望运镜或主体动作比较明显时,可以从 Kling 3.0 文生视频开始。第一版 Prompt 保持简单:一个主体、一个可见动作、一条运镜指令。可以直接进入文生视频生成器测试。
身份、裁切或开场画面已经确定时,两边都可以从图生视频开始。这一组里,O3 更准确地完成了眨眼顺序,Kling 3.0 的抬爪幅度更大。使用图生视频生成器时,原图最好已经接近最终构图。
参考视频提供了想要的节奏、动作风格或构图,并且还要结合图片时,可以从 O3 Reference to Video 开始。它会生成一个受参考素材引导的新视频,不是直接修改原视频。
核心任务是把动作轨迹转移到特定角色或物体上时,可以尝试 Kling 3.0 Motion Control。批量前一定先测一组。本次测试说明,看起来有效的图片也可能卡在特定路由的预处理阶段。
这组样本里各自适合什么
Kling 3.0 更适合这次需要明显推进和大幅前景动作的任务。它不适合用来确认指定眨眼是否落地;Motion Control 也没有接受本次匹配图片。
O3 更适合这次按顺序完成眨眼,也成功跑通了同素材参考任务。纸船镜头里,它没有明确胜出:两边都跟住了场景,选择取决于你需要更强推进,还是更平稳的过程。
这点样本不足以给所有项目设默认模型。应该先按已有素材选择入口,再测试最容易失败的那条要求:动作顺序、角色身份、运镜时间,或参考素材兼容性。
常见问题
Kling O3 就是 Kling VIDEO 3.0 Omni 吗?
Kling 官方名称是 VIDEO 3.0 Omni。EvoLink 和 KlingVideo 使用 Kling O3,指向基于该模型系列的提供商路由。不同界面的控件可能不完全相同,不能默认所有 Omni 功能到处都有。
O3 比 Kling 3.0 更好吗?
不能这样下通用结论。这次 O3 更清楚地完成了眨眼,也跑通了参考任务;Kling 3.0 的纸船推进更明显,前景动作更大。它们只是小样本里的工作流差异。
文生视频应该选哪个?
两边都完成了相同的 5 秒 Prompt,也都保住了核心场景。可以按需要的动作强度来选。时间点或运镜强度很重要时,至少生成两个候选。
有首帧图时应该选哪个?
两边都很好地保住了猫咪原图。这个样本里,O3 对眨眼更直接,Kling 3.0 更强调抬爪。原图的裁切、背景和主体细节最好一开始就正确。
Motion Control 和 Reference to Video 有什么区别?
Kling 3.0 Motion Control 明确用图片提供外观、用视频提供动作轨迹。O3 Reference to Video 把视频当作特征参考,还能结合图片或 Element。它们的输入有重叠,但不是同一种操作。
来源与限制
Kling 官方的 VIDEO 3.0 与 VIDEO 3.0 Omni 对比把标准模型描述为 Prompt 驱动,把 Omni 描述为参考驱动。EvoLink 当前文档列出了 KlingVideo 使用的 Kling 3.0 与 O3 文生视频、图生视频、Motion Control和 O3 Reference to Video路由。
直接画面对照来自 4 个 720p、5 秒、关闭声音的完成输出,共两组同输入样本。参考视频核验使用一组相同的图片与视频:O3 完成,Kling 3.0 两次停在图片处理。由一名审阅者检查接触表与文件信息。没有做重复生成、盲测、声音测试或逐帧指标。本文是一轮输入与工作流检查,不是永久模型排名。
最后核验:2026 年 8 月 4 日。



