
好用的对白提示词,顺序应该是场景、角色、说话顺序、动作、镜头、声音。
快速答案
用 Kling AI 做短剧对白时,把每句台词写成独立的时间节拍,并且每次都明确写出说话人。先固定角色,用角色 A、角色 B、角色 C 这样的简单标签,再给每个人一两个稳定的外观特征。随后依次写镜头、说话人的动作、准确台词,以及其他角色的无声反应。一条视频只处理一次简短交流,不要把整场戏都塞进一次生成。
KlingVideo 当前的 Kling 3.0 文生视频支持 4 到 15 秒、16:9、9:16、1:1、720p、1080p,以及声音开关。当前表单没有角色声线管理、分角色音轨,也没有语言或口音选择。对白意图需要写进提示词,结果生成后还要检查说话人归属、台词、节奏、口型和环境声。某一项失败时,先缩短这轮对白,再重新生成对应镜头。
让说话人更清楚的提示词结构
按固定顺序写六部分:
- 场景锁定: 地点、时间、光线和情绪。
- 角色锁定: 每个人的稳定标签和可见特征。
- 镜头: 景别、机位和运动。
- 说话节拍: 谁说话、做什么、说哪句、用什么语气。
- 听者反应: 给沉默角色一个小动作,保持身份清楚。
- 声音底层: 环境声和停顿。对白优先时不要加音乐。
Kling 官方 VIDEO 3.0 指南在多角色示例中明确绑定了角色与台词。这种写法值得参考,但不代表每次生成都能逐字还原台词或正确分配声音。提示词越清楚,后续检查和返工越容易。
可直接复制的基础模板
场景:[地点、时间、光线、情绪]。
角色:角色 A 是[可见特征]。角色 B 是[可见特征]。
镜头 1,[景别和机位]:角色 A [小动作],用[语气]说:“[短台词]”。角色 B 保持沉默,并做出[可见反应]。
镜头 2,[景别和机位]:角色 B [小动作],用[语气]回答:“[短台词]”。角色 A 保持沉默,并做出[可见反应]。
声音:对白清楚,环境底噪一致,[具体环境声],无背景音乐。
连续性:两个镜头中的面孔、服装、位置和道具保持一致。
不要只用“他”或“她”标记说话人。即使轮次很明显,也重复写角色 A、角色 B。
双人对白模板
夜晚室内,一家快打烊的社区餐厅,暖色顶灯,窗外下雨。角色 A 是坐在左侧、穿红色羊毛大衣的疲惫女人。角色 B 是坐在右侧、穿海军蓝工作夹克的无胡须男人。
镜头 1,角色 A 中近景,固定机位。角色 A 把一把黄铜钥匙推过桌面,平静而克制地说:“我在你的抽屉里找到了它。”角色 B 保持沉默,低头看钥匙,握紧咖啡杯。
镜头 2,角色 B 反打中近景。角色 B 抬起眼睛,低声犹豫地回答:“那你也知道我为什么离开了。”角色 A 保持沉默,把手从钥匙旁收回。
声音:对白清楚,玻璃上的轻微雨声,冰箱低鸣,无音乐。服装、桌边位置、黄铜钥匙和视线方向保持一致。
短台词能给停顿和反应留出时间。共同道具可以连接两个镜头,反打镜头则能清楚提示说话人已经切换。
三人对白模板
三个人同场时,每一轮只承担一个剧情目的。除非重叠说话对故事必不可少,否则不要让多人同时开口。
傍晚的小排练室。角色 A 是戴圆眼镜、手持批注剧本的年轻导演。角色 B 穿绿色毛衣,站在窗边。角色 C 穿黑色 T 恤,站在门旁。
镜头 1,三人全景。角色 A 依次看向 B 和 C,坚定平稳地说:“我们只剩最后一次机会。”B 和 C 保持沉默。
镜头 2,角色 B 中近景。角色 B 折起剧本一角,平静但紧张地说:“那就让我告诉他真相。”角色 C 虚化在背景中,停下伸向门把的手。
镜头 3,角色 C 特写。角色 C 转过身,克制而冷淡地回答:“你昨天就该说了。”角色 A 保持沉默,放低手里的批注剧本。
声音:对白清晰,空调低鸣,远处一次汽车喇叭,无音乐。所有人的面孔、服装、站位和批注剧本保持一致。
如果角色外观开始漂移,把三人镜头拆成独立片段,并在各镜头中复用相同的角色参考图或起始帧。

每个节拍只安排一位说话人,让画面和声音在同一时刻只处理一件事。
用说话轮次时间线规划场景
| 时间 | 说话人 | 画面 | 声音 |
|---|---|---|---|
| 0-3 秒 | 角色 A | 中近景,放下钥匙 | 第一句台词,安静室内声 |
| 3-6 秒 | 角色 B | 无台词的反应镜头 | 停顿和雨声 |
| 6-9 秒 | 角色 B | 反打特写 | 回答 |
| 9-12 秒 | 角色 A | 无声反应 | 环境底噪 |
无声节拍很有用。它能分开两种声音,给剪辑留下干净切点,也能让听者继续留在画面里。4 秒片段适合一句短台词。片段更长,也不用把每一秒都填满。
当前 KlingVideo 对白镜头设置
| 设置 | 当前选项 | 实际用法 |
|---|---|---|
| 时长 | 4-15 秒 | 每个片段一条台词或一次简短交流 |
| 画幅 | 16:9、9:16、1:1 | 构图前先匹配最终发布平台 |
| 分辨率 | 720p、1080p | 720p 测试,镜头稳定后再用 1080p |
| 声音 | 开或关 | 测试生成对白和环境声时开启 |
当前表单没有给角色 A、角色 B 单独选声线的控件,也没有分角色音轨、逐字锁定或口音菜单。可以把这些意图写进提示词,但重要台词仍要准备后期配音或替换方案。
需要完整声音流程,可以看 Kling 3.0 原生音频指南。需要镜头编排,可以看 Kling 3.0 多镜头提示词指南。制作完整剧集时,从 AI 短剧工作流 开始。
一次只排查一个问题

每次只改一个变量,再对比它是否解决了当前问题。
台词由错误的人说出
把代词改成重复的角色标签。让角色名紧挨“说”或“回答”。给听者一个明确的无声动作。多人同框时,切到当前说话人的特写或反打镜头。
两种声音重叠
把每句台词拆成独立镜头节拍,中间加停顿或无声反应。测试阶段去掉群众对白、音乐和不必要的声音指令。
台词被改写
缩短句子,每轮只放一句话。少用生僻名字、数字和绕口表达。台词必须逐字一致时,在后期替换生成声音。
面孔或服装漂移
减少一次生成中的切镜数量。在连续性说明里重复外观特征。系列内容要维护角色设定表,并在不同镜头复用已确认的参考图。
口型不自然
使用更近、更正面的角度,确保嘴部无遮挡。说话时减少快速身体动作,缩短台词,把反应动作放到台词之后。
环境声盖住对白
要求清楚的前景对白,只保留一种低音量环境声,并去掉音乐。如果混音仍不清楚,生成更干净的镜头或在剪辑软件中重做声音。
发布前检查
- 每位说话人都有稳定标签和外观特征。
- 每个节拍只有一位角色开口。
- 台词简短,并使用引号。
- 听者有无声反应。
- 镜头明确指向当前说话人。
- 环境声不会与对白竞争。
- 连续性说明包含服装、道具、位置和视线。
- 检查说话人归属、节奏、口型、身份和声音平衡。
- 关键台词有后期替换方案。
常见问题
Kling AI 能生成两人以上的对白吗?
Kling 官方 VIDEO 3.0 示例包含多角色家庭对话。角色越多,说话人、身份和节奏出错的机会也越多。每个节拍只安排一位说话人,可靠性要求高时把拥挤场景拆成多个镜头。
对白应该写成剧本格式吗?
可以使用剧本式的说话人标签,但每句台词周围还要补充画面和镜头指令。纯剧本只说明谁说话,镜头提示词还会说明观众应该看到什么。
每句台词多长合适?
从一句短句开始,给动作和反应留出时间。如果结果语速过快或漏词,先缩短台词,再考虑增加时长。
KlingVideo 可以给每个角色选择声音吗?
不可以。当前 Kling 3.0 表单有声音开关,但没有角色声线管理或分角色音轨。可以在提示词里描述声线,并在生成后检查结果。
怎样保证台词完全准确?
把生成台词视为待审内容,而不是锁定好的字幕。必须逐字一致的台词,建议后期重新配音或替换,并在最终剪辑中检查口型节奏。
开始制作下一段对白
打开 Kling AI 文生视频生成器,先选择最终发布所需的画幅。第一次测试只做一个说话轮次,使用上面的基础模板,确认结果后再增加第二句台词或第三个角色。
来源与方法
产品设置来自当前 KlingVideo 表单,能力示例来自 Kling 官方文档。本文模板是可测试的制作方法,不保证逐字对白、角色身份或口型每次都完全一致。



