
会話プロンプトは、場面、登場人物、発話順、動作、カメラ、音の順で固定すると整理しやすくなります。
すぐに使える答え
Kling AIで短編ドラマの会話を作るときは、セリフを1つずつ時間のビートに分け、毎回話者名を書きます。まず人物A、人物B、人物Cのような単純なラベルを決め、それぞれに1、2個の見た目の特徴を与えます。その後、カメラ、話者の動作、正確なセリフ、聞き手の無言の反応を順に指定します。1回の生成には、場面全体ではなく短いやり取りを1つだけ入れるのが安全です。
KlingVideoの現在のKling 3.0 Text-to-Videoでは、4〜15秒、16:9、9:16、1:1、720p、1080p、サウンドのオン・オフを選べます。一方、人物別の声を管理する機能、話者ごとの音声トラック、言語やアクセントの選択機能はありません。生成後は、話者の割り当て、文言、タイミング、口の動き、環境音を確認してください。
話者を明確にする6つのブロック
- 場面の固定: 場所、時間、照明、雰囲気。
- 人物の固定: 安定したラベルと見た目の特徴。
- ショット: 画角、カメラ位置、動き。
- 発話ビート: 誰が、何をし、何を、どんな調子で言うか。
- 聞き手の反応: 無言の人物を識別できる小さな動作。
- 音: 環境音と間。会話を優先するときは音楽を外します。
Kling公式のVIDEO 3.0ガイドでも、複数人物の例で人物とセリフが明示的に結び付けられています。これは有効な書式ですが、すべての生成でセリフや声の割り当てが完全に再現される保証ではありません。
コピー用の基本テンプレート
場面:[場所、時間、照明、雰囲気]。
登場人物:人物Aは[見た目の特徴]。人物Bは[見た目の特徴]。
ショット1、[画角とカメラ]:人物Aが[小さな動作]をして、[口調]で「[短いセリフ]」と言う。人物Bは黙ったまま[見える反応]をする。
ショット2、[画角とカメラ]:人物Bが[小さな動作]をして、[口調]で「[短いセリフ]」と返す。人物Aは黙ったまま[見える反応]をする。
音:明瞭な会話、一貫した室内音、[具体的な環境音]、BGMなし。
連続性:顔、衣装、位置、小道具を両ショットで維持する。
話者を「彼」「彼女」だけで示さないでください。順番が明らかでも人物A、人物Bを繰り返します。
2人の会話テンプレート
夜、閉店間際の小さな食堂。暖色の天井灯、窓の外は雨。人物Aは左側に座る、赤いウールコートを着た疲れた女性。人物Bは右側に座る、紺色の作業ジャケットを着た髭のない男性。
ショット1、人物Aのミディアムクローズアップ、固定カメラ。人物Aは真鍮の鍵をテーブルの向こうへ滑らせ、静かに抑えた声で「あなたの机で見つけた」と言う。人物Bは黙って鍵を見下ろし、コーヒーカップを強く握る。
ショット2、人物Bの切り返し。人物Bは目を上げ、低くためらう声で「なら、僕が去った理由も分かるはずだ」と返す。人物Aは黙り、鍵から手を引く。
音:明瞭な会話、窓を打つ弱い雨、冷蔵庫の低い音、音楽なし。衣装、席、鍵、視線を維持する。
短いセリフなら、間と反応を入れる余裕が残ります。共通の小道具はショット同士をつなぎ、切り返しは話者の交代を画面で示します。
3人の会話テンプレート
3人では、各ターンに1つの役割だけを持たせます。物語上必要でない限り、同時に話させないでください。
夕方の小さな稽古場。人物Aは丸眼鏡をかけ、書き込みのある台本を持つ若い演出家。人物Bは緑のセーター姿で窓際に立つ。人物Cは黒いTシャツ姿でドアのそばにいる。
ショット1、3人のワイド。人物AはBとCを順に見て、はっきりと「残りは1テイクだけだ」と言う。BとCは黙っている。
ショット2、人物Bのミディアムクローズアップ。人物Bは台本の角を折り、緊張を抑えて「なら、僕が真実を話す」と言う。背景の人物Cはドアに伸ばした手を止める。
ショット3、人物Cのクローズアップ。人物Cは振り返り、冷静に「昨日そうするべきだった」と返す。人物Aは黙って台本を下げる。
音:聞き取りやすい会話、エアコンの低音、遠くのクラクション1回、音楽なし。顔、衣装、位置、台本を維持する。
人物が崩れる場合は、3人の場面を別々のクリップに分け、同じ人物参照画像や開始フレームを使います。

1ビートにつき話者は1人。映像と音が同時に処理する仕事を絞ります。
話者ターンを時間で設計する
| 時間 | 話者 | 映像 | 音 |
|---|---|---|---|
| 0〜3秒 | 人物A | 鍵を置くミディアム | 最初のセリフ、室内音 |
| 3〜6秒 | 人物B | 無言の反応 | 間と雨音 |
| 6〜9秒 | 人物B | 切り返しのアップ | 返答 |
| 9〜12秒 | 人物A | 無言の反応 | 室内音 |
無言のビートは声を分離し、編集の切り口を作り、聞き手を画面に残します。4秒なら短いセリフを1つ。長いクリップでも、すべての秒を埋める必要はありません。
現在のKlingVideo設定
| 設定 | 選択肢 | 使い方 |
|---|---|---|
| 長さ | 4〜15秒 | 1クリップに1つのセリフか短いやり取り |
| アスペクト比 | 16:9、9:16、1:1 | 最終配信先に合わせてから構図を決める |
| 解像度 | 720p、1080p | 720pで試し、安定後に1080p |
| サウンド | オン・オフ | 会話と環境音の確認時はオン |
人物ごとの声、個別音声トラック、セリフの完全固定、アクセント選択は現在のフォームにありません。声の意図はプロンプトに書けますが、重要な文言には編集や再収録の代替案を用意してください。
音の設計はKling 3.0ネイティブオーディオガイド、カメラの順序はKling 3.0マルチショットプロンプトガイド、全体制作はAI短編ドラマのワークフローも参照できます。
問題を1つずつ直す

変数を1つだけ変え、その失敗が改善したかを比べます。
別の人物がセリフを言う
代名詞を人物ラベルに置き換え、人物名の直後に「言う」「返す」を置きます。聞き手には無言の動作を与えます。複数人が映る場合は、話者のアップか切り返しにします。
声が重なる
各セリフを別のショットビートに分け、間に無言の反応を置きます。テスト中は群衆の声、音楽、不要な効果音を外します。
文言が変わる
1ターンを短い1文にします。珍しい名前、数字、言いにくい表現を減らします。文言が必須なら、編集で音声を差し替えます。
顔や衣装が変わる
1回の生成に含めるカットを減らし、連続性の行で特徴を繰り返します。シリーズでは人物設定表と承認済みの参照画像を使います。
口の動きが弱い
口が隠れない、正面寄りの近い画角を使います。発話中の速い全身動作を減らし、反応はセリフの後に置きます。
環境音が会話を隠す
前景の会話を明瞭にし、低い環境音を1種類だけ指定します。音楽は外します。改善しない場合は、より静かなショットを作るか編集で音を組み直します。
制作チェックリスト
- 全話者に安定したラベルと外見の特徴がある。
- 1ビートで話すのは1人だけ。
- セリフは短く、引用符で囲まれている。
- 聞き手に無言の反応がある。
- カメラが現在の話者を明確に示す。
- 環境音が会話を邪魔しない。
- 衣装、小道具、位置、視線が連続性メモにある。
- 話者、タイミング、口の動き、人物、音量を確認する。
- 重要なセリフには編集時の代替案がある。
よくある質問
Kling AIは3人以上の会話を生成できますか?
Kling公式のVIDEO 3.0例には複数人物の家族会話があります。ただし、人数が増えるほど話者、人物、タイミングの失敗も増えます。1ビート1話者にし、必要なら別ショットへ分けてください。
脚本形式で書くべきですか?
話者ラベルは脚本形式で構いませんが、各セリフに画面とカメラの指示を加えます。脚本は誰が話すかを示し、ショットプロンプトは観客が何を見るかも示します。
1行の長さはどれくらいですか?
短い1文から始めます。早口や語句の欠落が起きたら、長さを増やす前にセリフを短くします。
人物ごとに声を選べますか?
現在のKling 3.0フォームにはサウンド設定がありますが、人物別の声や音声トラックはありません。声質を文章で指定し、生成後に確認します。
セリフを正確に保つ方法はありますか?
生成音声は固定済みの台本ではなく、確認が必要な素材として扱います。完全一致が必要な行は、編集で再収録または差し替え、最終版で口のタイミングを確認してください。
次の会話ショットを作る
Kling AI Text-to-Videoを開き、配信先のアスペクト比を選びます。最初は1人の1ターンだけを基本テンプレートで試し、結果を確認してから次のセリフや人物を加えます。
出典と確認方法
製品設定は現在のKlingVideoフォーム、機能例はKling公式資料で確認しました。ここにあるテンプレートは検証用の制作パターンであり、セリフ、人物、口の動きの完全一致を保証するものではありません。



