> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-custom-nodes-sdk-v2-frontend.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# WanInfiniteTalkToVideo - ComfyUI Built-in Node Documentation

> WanInfiniteTalkToVideoは、音声入力からビデオシーケンスを生成します。

WanInfiniteTalkToVideoは、音声入力からビデオシーケンスを生成します。1人または2人の話者から抽出された音声特徴を条件として、ビデオ拡散モデルを使用し、トーキングヘッドビデオの潜在表現を生成します。このノードは、新しいシーケンスを生成するか、モーションコンテキストとして以前のフレームを使用して既存のシーケンスを拡張できます。

## 入力

### 共通入力

| パラメータ           | 説明                                                                                                | データ型                   | 必須  | 範囲                                       |
| --------------- | ------------------------------------------------------------------------------------------------- | ---------------------- | --- | ---------------------------------------- |
| `モード`           | 音声入力モード。`single_speaker` は1つの音声入力を使用します。`two_speakers` は、「2人話者入力」セクションに記載されている追加の音声入力とマスクを有効にします。 | DYNAMIC\_COMBO         | はい  | `"single_speaker"`<br />`"two_speakers"` |
| `モデル`           | ベースとなるビデオ拡散モデル。                                                                                   | MODEL                  | はい  | -                                        |
| `モデルパッチ`        | 音声投影レイヤーを含むモデルパッチ。                                                                                | MODEL\_PATCH           | はい  | -                                        |
| `ポジティブ`         | 生成をガイドするポジティブコンディショニング。                                                                           | CONDITIONING           | はい  | -                                        |
| `ネガティブ`         | 生成をガイドするネガティブコンディショニング。                                                                           | CONDITIONING           | はい  | -                                        |
| `vae`           | 画像を潜在空間との間でエンコードするために使用されるVAE。                                                                    | VAE                    | はい  | -                                        |
| `幅`             | 出力ビデオの幅（ピクセル単位）。16で割り切れる必要があります。（デフォルト: 832）                                                      | INT                    | はい  | 16 - MAX\_RESOLUTION (step 16)           |
| `高さ`            | 出力ビデオの高さ（ピクセル単位）。16で割り切れる必要があります。（デフォルト: 480）                                                     | INT                    | はい  | 16 - MAX\_RESOLUTION (step 16)           |
| `長さ`            | 生成するフレーム数。（デフォルト: 81）                                                                             | INT                    | はい  | 1 - MAX\_RESOLUTION (step 4)             |
| `clipビジョン出力`    | 追加のコンディショニングのためのオプションのCLIPビジョン出力。                                                                 | CLIP\_VISION\_OUTPUT   | いいえ | -                                        |
| `開始画像`          | ビデオシーケンスを初期化するためのオプションの開始画像。                                                                      | IMAGE                  | いいえ | -                                        |
| `オーディオエンコーダ出力1` | 最初の話者の特徴を含むプライマリ音声エンコーダ出力。                                                                        | AUDIO\_ENCODER\_OUTPUT | はい  | -                                        |
| `モーションフレーム数`    | モーションコンテキストとして使用する前のフレーム数。（デフォルト: 9）                                                              | INT                    | はい  | 1 - 33                                   |
| `オーディオスケール`     | 音声コンディショニングに適用されるスケーリング係数。（デフォルト: 1.0）                                                            | FLOAT                  | はい  | -10.0 - 10.0                             |
| `前のフレーム`        | 拡張元となるオプションの以前のビデオフレーム。最後の `motion_frame_count` フレームがモーションコンテキストとして使用されます。                        | IMAGE                  | いいえ | -                                        |

### 2人話者入力

このセクションの入力は、`mode` が `"two_speakers"` に設定されている場合に表示されます。

| パラメータ                    | 説明                              | データ型                   | 必須  | 範囲 |
| ------------------------ | ------------------------------- | ---------------------- | --- | -- |
| `audio_encoder_output_2` | 2番目の話者の特徴を含む2番目の音声エンコーダ出力。      | AUDIO\_ENCODER\_OUTPUT | いいえ | -  |
| `mask_1`                 | 最初の話者のマスク。2つの音声入力を使用する場合に必要です。  | MASK                   | いいえ | -  |
| `mask_2`                 | 2番目の話者のマスク。2つの音声入力を使用する場合に必要です。 | MASK                   | いいえ | -  |

**パラメータ制約:**

* `mode` が `"two_speakers"` に設定されている場合、2番目の話者のセットアップには `audio_encoder_output_2`、`mask_1`、`mask_2` が必要です。
* `audio_encoder_output_2` が提供される場合、`mask_1` と `mask_2` の両方も提供する必要があります。
* `mask_1` と `mask_2` の両方が提供される場合、`audio_encoder_output_2` も提供する必要があります。
* `previous_frames` が提供される場合、`motion_frame_count` で指定されたフレーム数以上のフレームが含まれている必要があります。

## 出力

| 出力名     | 説明                                                                                                            | データ型         |
| ------- | ------------------------------------------------------------------------------------------------------------- | ------------ |
| `モデル`   | 音声コンディショニングが適用されたパッチ済みモデル。                                                                                    | MODEL        |
| `ポジティブ` | 開始画像やCLIPビジョン出力などの追加コンテキストで変更される可能性のあるポジティブコンディショニング。                                                         | CONDITIONING |
| `ネガティブ` | 追加コンテキストで変更される可能性のあるネガティブコンディショニング。                                                                           | CONDITIONING |
| `潜在`    | 潜在空間で生成されたビデオシーケンス。                                                                                           | LATENT       |
| `トリム画像` | シーケンスを拡張する際にモーションコンテキストの先頭からトリミングするフレーム数。`previous_frames` が提供されている場合は `motion_frame_count` に等しく、それ以外の場合は0です。 | INT          |

> このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください！ [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/WanInfiniteTalkToVideo/ja.md)

***

**Source fingerprint (SHA-256):** `b7359490c1de86d9c82122bc227295b3b7f8a3493f629365ae0f22f9f34d9a66`
