快速答案
开始 Kling AI 图生视频之前,先检查 7 件事:主体是否清晰,重要边缘是否可见,人物肢体或产品轮廓有没有被裁切,背景是否足够简单,画面是否给动作留出了空间,提示词有没有分清“必须保持不变”和“需要发生运动”的部分,以及结尾姿态是否明确。这份清单适合已经选好图生视频入口、准备提交任务的用户,不重复基础按钮流程。
参考图干净,并不代表一定能生成理想视频,但它能先排除一批不必要的变形风险。快手 Kling AI 官方指南建议用“主体 + 运动”组织提示词,也明确展示了模糊动作词可能被误解。KlingVideo 当前的图生视频入口会同时读取起始图和提示词,所以两者必须互相支持。如果参考图只有半身,提示词却要求人物完整转身并走出三步,应该先修正输入组合,再消耗积分重试。

生成前先过这 7 项
| 检查项 | 要看什么 | 提交前怎么修 |
|---|---|---|
| 主体清晰度 | 面部、产品形状或插画主角能否一眼识别 | 换成更清晰、焦点更明确的图片 |
| 边缘 | 头发、手、衣物或产品轮廓是否和背景分开 | 提高对比度,或换成更干净的背景 |
| 遮挡 | 关节、把手、标签、面部特征有没有被挡住 | 换一个能露出计划运动部位的视角 |
| 裁切 | 画面是否包含动作所需的身体或物体区域 | 扩大画幅,不要让模型凭空补全缺失部位 |
| 背景 | 线条和杂物会不会和主体争夺注意力 | 简化场景,或减少镜头运动 |
| 动作空间 | 主体前进方向有没有余量 | 重新构图,避免动作一开始就撞到画面边缘 |
| 图文一致 | 固定元素、动作、镜头和结尾有没有冲突 | 把提示词拆成四个明确决定 |
按这个顺序检查更省时间。提示词写得再长,也无法让被身体完全挡住的手变得可见;参考图再清楚,也解决不了两个相反的镜头指令。
检查主体、边缘、遮挡、背景和画幅
先看主体。人物图要检查脸、手、脚、发际线,以及和身体重叠的衣物。产品图要检查轮廓、边角、标签、反光和接触面。插画则要确认角色线条没有和装饰线混在一起。
接着用眼睛沿主体外缘走一遍。主体和背景颜色太接近,会让边界变得模糊。比如树枝刚好穿过头发、黑色袖子贴着深色墙面,或透明瓶身放在高反射玻璃前,都会让起始帧变得难判断。多数时候,更有效的修复是换一张参考图,不是继续堆提示词。
动作需要用到被遮挡部位时,问题会更明显。半身肖像不适合“人物完整后退三步”这样的请求,因为双腿既不在图里,还要在运动中被补出来。可以改成符合当前裁切范围的小动作,或者重新准备一张全身图。
最后看空间。滑板人物已经贴着右边缘,再要求快速向右滑,镜头没有继续容纳动作的位置。更合理的做法是重新构图,或者把动作幅度缩小并固定镜头。
把固定元素、动作、镜头和结尾分开写
Kling 官方图生视频指南使用“主体 + 运动”的简洁公式。实际制作时,可以把它再拆清楚一点,但不需要堆成一大段形容词。

可以使用下面的结构:
固定元素:保持红色陶瓷杯、印刷 Logo 和木桌不变。
动作:一只手从左侧进入,轻轻把杯子旋转四分之一圈。
镜头:固定中近景,不变焦,不平移。
结尾停留:手离开画面,杯子在最后一秒保持静止。
“固定元素”负责保护不能漂移的身份特征;“动作”只给一个可读的主要行为;“镜头”决定是主体动还是观看位置动;“结尾停留”则避免视频停在一个没有定义的过渡状态。
不要把冲突指令塞在一起。“固定镜头、戏剧性环绕、特写、最后变成航拍大全景”没有明确优先级。第一次测试只保留一个真正需要判断的镜头行为。
官方指南还给出了一个很实用的语言提醒:“戴着太阳镜”如果写得含糊,可能被理解成“把太阳镜戴上”的动作。可见状态和动作要分开描述,例如:“人物始终戴着黑色太阳镜。她把头轻轻转向窗户。”
人物、产品和插画要保护的重点不同
| 输入类型 | 首先保护 | 更容易判断的动作 | 常见可避免问题 |
|---|---|---|---|
| 人物肖像 | 脸型、眼睛、发际线、双手 | 转头、眨眼、小幅身体移动 | 让紧裁切肖像生成图中不存在的全身动作 |
| 产品 | 轮廓、Logo、材质、与桌面的接触 | 缓慢旋转、受控的手部互动 | 大幅镜头移动时反光和标签发生变化 |
| 插画 | 角色外轮廓、线条风格、色块 | 一个明确的角色动作 | 装饰线和运动肢体混在一起 |
人物测试可以先从小动作开始。如果身份一致性最重要,第一次可只测试眨眼、轻微转头或身体重心变化。产品要保持几何形状和标签可读,固定镜头更容易判断首轮结果。插画缺少真实摄影的深度线索,更需要角色与背景清楚分离。
一个可以在生成前复核的好坏案例
假设两张图都准备使用同一条请求:“一名女性向前走两步,抬起右手,并保持最终姿态。全身固定镜头。”
较好的输入: 清晰的全身图,双手双脚完整可见,背景简单,人物靠近画面中央,前方留有空间。参考图和动作使用同一种全身构图。
较差的输入: 半身肖像,右手藏在身体后面,一侧肩膀被裁掉,背景还有多个人和花纹。它没有展示动作需要的部位,同时提供了多个容易混淆的形状。
这只是输入质量诊断,不是“好图一定成功”的承诺。案例在生成前就能复核:动作需要的部位是否可见,画幅是否容得下动作,背景是否会和主体竞争。
症状、输入问题和第一步修复
| 结果症状 | 优先检查的输入冲突 | 第一步修复 |
|---|---|---|
| 脸或产品身份变化 | 身份特征太小或不清楚 | 换更清晰、更大的主体,并缩小动作幅度 |
| 多出肢体或肢体变形 | 关节被挡、裁切太紧、物体重叠 | 换成肢体可见、遮挡更少的参考图 |
| 背景弯曲或漂移 | 复杂背景叠加镜头或主体运动 | 简化背景,或固定镜头 |
| 主体离开画面 | 运动方向没有预留空间 | 重新构图,或缩短移动距离 |
| 动作开头正常、结尾别扭 | 没有定义最终状态 | 加入短暂的结尾停留和最终姿态 |
| 镜头行为不可预测 | 同一提示词里有多个镜头方向 | 测试时只保留一个镜头指令 |
这些是排查优先级,不是一一对应的结论。每次只改一个输入,才能知道到底是参考图、动作还是镜头指令产生了影响。
提交前 Prompt 检查清单
把图片和提示词放在一起读一遍:
- 动作需要的关键部位是否都能看到?
- 主体是否足够大、足够清楚?
- 背景和主体是否容易区分?
- 动作方向有没有足够空间?
- 是否写明了必须保持不变的元素?
- 是否只保留一个主要动作和一种镜头行为?
- 是否描述了最终姿态或结尾停留?
- 这次是不是只测试一个变化?
前四项有一项不满足,优先换图;第五到第七项冲突,则先简化提示词。模型能力和支持设置可以查看 Kling 3.0,当前生成入口见 KlingVideo 图生视频。
常见问题
什么样的图片最适合 Kling AI 图生视频?
优先选择主体明确、特征和关节可见、边缘干净、背景不过度抢眼,并且为计划动作留出空间的清晰图片。合适裁切取决于动作:半身图适合小幅转头,不适合全身行走。
提示词需要把图片重新描述一遍吗?
不需要罗列每个可见物体。写清楚哪些身份细节必须保持不变,再描述动作、镜头和结尾即可。重点放在“如果发生变化,结果就会出错”的部分。
我只让人物动,为什么背景也会动?
先检查背景是不是过于复杂,以及提示词是否同时要求了镜头运动。用更简单的背景或固定镜头做一次对照,再判断主要问题来自哪里。
更长的提示词能修复被裁掉或挡住的肢体吗?
不可靠。提示词能请求动作,但不能提供参考图里不存在的视觉证据。换一张更宽的图片,或者让动作适应当前可见范围。
第一次就应该用最高设置生成吗?
先用一个可控的短测试回答最重要的问题。确认图片和动作一致后,再选择交付需要的输出设置。
用 KlingVideo 让图片动起来
准备一张通过视觉检查的参考图,只保留一个主要动作和一种镜头选择,然后开始图生视频。首轮结果不符合目标时,先改最可能的输入冲突,不要一次把所有条件都换掉。
来源与方法
- Kling AI Image-to-Video Guide,快手 Kling AI 官方文档。用于核验“主体 + 运动”提示词结构,以及模糊动作表述可能产生误解的提醒。访问日期:2026-07-21。
- Kling 3.0 与 KlingVideo 图生视频,KlingVideo 当前产品页。用于确认站内工作流和入口。核验日期:2026-07-21。
好坏参考图案例属于生成前输入审查,依据是可见画幅、遮挡和图文一致性。本文没有为案例运行付费生成,也不承诺某张图片一定得到特定结果。最后核验:2026-07-21。