> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-custom-nodes-sdk-v2-frontend.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# WanInfiniteTalkToVideo - ComfyUI Built-in Node Documentation

> WanInfiniteTalkToVideo 根据音频输入生成视频序列。

WanInfiniteTalkToVideo 根据音频输入生成视频序列。它使用视频扩散模型，以从一个或两个说话人提取的音频特征为条件，生成说话人头部视频的潜在表示。该节点可以生成新序列，或使用先前帧作为运动上下文来扩展现有序列。

## 输入

### 通用输入

| 参数         | 描述                                                                         | 数据类型                   | 必填 | 范围                                       |
| ---------- | -------------------------------------------------------------------------- | ---------------------- | -- | ---------------------------------------- |
| `模式`       | 音频输入模式。`single_speaker` 使用一个音频输入。`two_speakers` 启用“双说话人输入”部分中列出的额外音频输入和遮罩。 | DYNAMIC\_COMBO         | 是  | `"single_speaker"`<br />`"two_speakers"` |
| `模型`       | 基础视频扩散模型。                                                                  | MODEL                  | 是  | -                                        |
| `模型补丁`     | 包含音频投影层的模型补丁。                                                              | MODEL\_PATCH           | 是  | -                                        |
| `正向提示`     | 用于引导生成的正向条件。                                                               | CONDITIONING           | 是  | -                                        |
| `负向提示`     | 用于引导生成的负向条件。                                                               | CONDITIONING           | 是  | -                                        |
| `vae`      | 用于在图像和潜在空间之间进行编码的 VAE。                                                     | VAE                    | 是  | -                                        |
| `宽度`       | 输出视频的宽度（像素）。必须能被 16 整除。（默认值：832）                                           | INT                    | 是  | 16 - MAX\_RESOLUTION（步长 16）              |
| `高度`       | 输出视频的高度（像素）。必须能被 16 整除。（默认值：480）                                           | INT                    | 是  | 16 - MAX\_RESOLUTION（步长 16）              |
| `长度`       | 要生成的帧数。（默认值：81）                                                            | INT                    | 是  | 1 - MAX\_RESOLUTION（步长 4）                |
| `clip视觉输出` | 用于额外条件的可选 CLIP vision 输出。                                                  | CLIP\_VISION\_OUTPUT   | 否  | -                                        |
| `起始图像`     | 用于初始化视频序列的可选起始图像。                                                          | IMAGE                  | 否  | -                                        |
| `音频编码器输出1` | 包含第一个说话人特征的主音频编码器输出。                                                       | AUDIO\_ENCODER\_OUTPUT | 是  | -                                        |
| `运动帧数`     | 用作运动上下文的先前帧数。（默认值：9）                                                       | INT                    | 是  | 1 - 33                                   |
| `音频缩放`     | 应用于音频条件的缩放因子。（默认值：1.0）                                                     | FLOAT                  | 是  | -10.0 - 10.0                             |
| `前置帧`      | 用于扩展的可选先前视频帧。最后 `motion_frame_count` 帧将用作运动上下文。                            | IMAGE                  | 否  | -                                        |

### 双说话人输入

当 `mode` 设置为 `"two_speakers"` 时，将显示此部分中的输入。

| 参数                       | 描述                       | 数据类型                   | 必填 | 范围 |
| ------------------------ | ------------------------ | ---------------------- | -- | -- |
| `audio_encoder_output_2` | 包含第二个说话人特征的第二个音频编码器输出。   | AUDIO\_ENCODER\_OUTPUT | 否  | -  |
| `mask_1`                 | 第一个说话人的遮罩，如果使用两个音频输入则必填。 | MASK                   | 否  | -  |
| `mask_2`                 | 第二个说话人的遮罩，如果使用两个音频输入则必填。 | MASK                   | 否  | -  |

**参数约束：**

* 当 `mode` 设置为 `"two_speakers"` 时，对于第二个说话人设置，`audio_encoder_output_2`、`mask_1` 和 `mask_2` 为必填项。
* 如果提供了 `audio_encoder_output_2`，则还必须提供 `mask_1` 和 `mask_2`。
* 如果同时提供了 `mask_1` 和 `mask_2`，则还必须提供 `audio_encoder_output_2`。
* 如果提供了 `previous_frames`，则其帧数必须至少达到 `motion_frame_count` 指定的数量。

## 输出

| 输出名称     | 描述                                                                           | 数据类型         |
| -------- | ---------------------------------------------------------------------------- | ------------ |
| `模型`     | 已应用音频条件的修补模型。                                                                | MODEL        |
| `正向提示`   | 正向条件，可能已通过额外上下文（如起始图像或 CLIP vision 输出）进行修改。                                  | CONDITIONING |
| `负向提示`   | 负向条件，可能已通过额外上下文进行修改。                                                         | CONDITIONING |
| `latent` | 在潜在空间中生成的视频序列。                                                               | LATENT       |
| `裁剪图像`   | 扩展序列时，应从运动上下文开头裁剪的帧数。当提供了 `previous_frames` 时，等于 `motion_frame_count`，否则为 0。 | INT          |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/WanInfiniteTalkToVideo/zh.md)

***

**Source fingerprint (SHA-256):** `b7359490c1de86d9c82122bc227295b3b7f8a3493f629365ae0f22f9f34d9a66`
