> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-custom-nodes-sdk-v2-frontend.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMaxH3ReferenceToVideo - ComfyUI Built-in Node Documentation

> MiniMax H3 Reference to Video 节点创建迷你 Max H3 参考转视频生成所需的文本条件和空音频-视频潜空间。

MiniMax H3 Reference to Video 节点创建迷你 Max H3 参考转视频生成所需的文本条件和空音频-视频潜空间。您提供提示词以及可选的参考图像、视频和音频片段，节点会将这些参考编码为模型生成时可使用的令牌。提示词通过 `<Picture i>`、`<Video k>` 和 `<Audio j>` 标签引用参考内容。

## 输入

| 参数          | 描述                                                                                                               | 数据类型   | 是否必需 | 范围                     |
| ----------- | ---------------------------------------------------------------------------------------------------------------- | ------ | ---- | ---------------------- |
| `clip`      | 用于对提示词进行分词，并将参考媒体编码为条件令牌的 CLIP 模型。                                                                               | CLIP   | 是    |                        |
| `vae`       | 用于将参考图像和参考视频帧编码为潜空间的 VAE。                                                                                        | VAE    | 是    |                        |
| `audio_vae` | 用于将参考音频编码为潜空间的 VAE。音频会重采样到音频 VAE 的采样率（默认 32 kHz）。                                                                | VAE    | 是    |                        |
| `提示词`       | 视频的文本提示词。可通过 `<Picture i>`、`<Video k>` 和 `<Audio j>` 标签（每种类型从 1 开始编号）引用参考媒体。支持多行和动态提示词。                          | STRING | 是    |                        |
| `宽度`        | 生成视频的宽度（像素），默认 1344。                                                                                             | INT    | 是    | 32 到 16384（步长 32）      |
| `高度`        | 生成视频的高度（像素），默认 768。                                                                                              | INT    | 是    | 32 到 16384（步长 32）      |
| `长度`        | 24 fps 下的帧数；124 约等于 5 秒，训练范围约为 124-362（默认 124）。                                                                  | INT    | 是    | 5 到 3600（步长 17）        |
| `参考图像尺寸`    | 参考图像缩放。`match` 仅将每张参考图像按比例缩小到生成的像素面积；`max` 使用参考管线的 2048px 短边以获得最佳身份保真度。参考令牌会贯穿每个采样步骤，因此 `max` 可能慢数倍（默认 `match`）。 | COMBO  | 是    | `"match"`<br />`"max"` |
| `参考图像`      | 可增长插槽：连接 1 到 9 张参考图像（`ref_image_1` ... `ref_image_9`）。每张图像如果超过 2048px 短边则缩小，并且绝不放大。                              | IMAGE  | 否    | 0 到 9                  |
| `参考视频`      | 可增长插槽：连接 1 到 3 个参考视频（`ref_video_1` ... `ref_video_3`）。参考视频帧率为 24 fps（2-15 秒）。                                    | IMAGE  | 否    | 0 到 3                  |
| `参考视频音频`    | 可增长插槽：连接 1 到 3 条音轨（`ref_video_audio_1` ... `ref_video_audio_3`）。与相同编号的参考视频对应的音轨。                                 | AUDIO  | 否    | 0 到 3                  |
| `参考音频`      | 可增长插槽：连接 1 到 3 段独立的参考音频片段（`ref_audio_1` ... `ref_audio_3`）。                                                      | AUDIO  | 否    | 0 到 3                  |

说明：

* 提示词使用每种类型从 1 开始的标签引用参考媒体：`<Picture i>` 用于图像，`<Video k>` 用于视频，`<Audio j>` 用于音频。参考内容以固定顺序呈现给模型：先是图像，然后是视频（每条音轨的 `<Audio j>` 标签紧跟在其 `<Video k>` 之前），最后是独立音频。
* 参考视频必须至少包含 5 帧（24 fps 下约 0.2 秒），否则节点会报错。视频帧数还会被限制到所选的 `length`，并裁剪到受支持的帧数。
* 在创建潜空间之前，请求的 `length` 会对齐到受支持的帧数。

## 输出

| 输出名称     | 描述                                                | 数据类型         |
| -------- | ------------------------------------------------- | ------------ |
| `正向`     | 包含编码后的提示词以及 MiniMax H3 模型使用的编码参考图像、视频和音频令牌的条件。    | CONDITIONING |
| `latent` | 按请求的 `width`、`height` 和 `length`（帧数）创建的空音频-视频潜空间。 | LATENT       |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/MiniMaxH3ReferenceToVideo/zh.md)

***

**Source fingerprint (SHA-256):** `d9a444e712cdc255d7c56a3ab38d0523659f198b3228b9283a7028cfd0e4f3f9`
