> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-custom-nodes-sdk-v2-frontend.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# WanSoundImageToVideoExtend - ComfyUI Built-in Node Documentation

> WanSoundImageToVideoExtend 节点用于扩展现有的视频潜在变量，生成额外帧，并可选择由音频、参考图像和控制视频引导。

WanSoundImageToVideoExtend 节点用于扩展现有的视频潜在变量，生成额外帧，并可选择由音频、参考图像和控制视频引导。它以起始视频潜在变量为基础，生成更长的视频序列，并利用所提供的条件和音频线索来影响新内容。

## 输入

| 参数        | 描述                                                                       | 数据类型               | 必需 | 范围                   |
| --------- | ------------------------------------------------------------------------ | ------------------ | -- | -------------------- |
| `正面提示词`   | 正向条件提示，用于引导视频应包含的内容                                                      | CONDITIONING       | 是  | -                    |
| `负面提示词`   | 负向条件提示，用于指定视频应避免的内容                                                      | CONDITIONING       | 是  | -                    |
| `VAE`     | 用于将参考图像和控制视频编码到潜在空间的变分自编码器                                               | VAE                | 是  | -                    |
| `长度`      | 为视频序列生成的总帧数（默认值：77，步长：4）                                                 | INT                | 是  | 1 to MAX\_RESOLUTION |
| `视频潜变量`   | 用作扩展起点的初始视频潜在变量。输出的宽度、高度、批大小和帧偏移均由此潜在变量推导得出。其最后 19 帧用作参考运动条件。            | LATENT             | 是  | -                    |
| `音频编码器输出` | 可选的音频嵌入，可根据声音特征影响视频生成。提供时，音频会被插值并转换为音频嵌入桶，添加到条件中。                        | AUDIOENCODEROUTPUT | 否  | -                    |
| `参考图像`    | 可选的参考图像，为视频生成提供视觉引导。图像会被放大以匹配目标尺寸，并编码为潜在表示，然后同时添加到正向和负向条件中。仅使用批次中的第一张图像。 | IMAGE              | 否  | -                    |
| `控制视频`    | 可选的控制视频，用于引导生成视频的运动和结构。视频会被放大、编码，并同时添加到正向和负向条件中。控制视频会被截断到指定的 `length`。   | IMAGE              | 否  | -                    |

注意：输出潜在变量会以目标尺寸初始化为零。输入 `video_latent` 不会被复制到此输出中，而是将其最后 19 帧用作参考运动。

## 输出

| 输出名称    | 描述                                                      | 数据类型         |
| ------- | ------------------------------------------------------- | ------------ |
| `正面提示词` | 已处理的、应用了视频上下文的正向条件，包括音频嵌入、参考潜在表示、参考运动以及控制视频（如果提供）       | CONDITIONING |
| `负面提示词` | 已处理的、应用了视频上下文的负向条件，包括音频嵌入（已置零）、参考潜在表示、参考运动以及控制视频（如果提供）  | CONDITIONING |
| `潜变量`   | 扩展序列的视频潜在表示，初始化为零，其尺寸由输入 `video_latent` 和目标 `length` 决定 | LATENT       |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/WanSoundImageToVideoExtend/zh.md)

***

**Source fingerprint (SHA-256):** `32b58aaba566f346a0388ba804fc92e7ad426bf2e9e7039e5fdb0bf6a746e972`
