> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-custom-nodes-sdk-v2-frontend.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 在 ComfyUI 中使用 MiniMax H3 API 进行视频生成

> 了解如何通过云端工作流在 ComfyUI 中使用 MiniMax H3 API 节点进行文生视频、首尾帧视频和参考生视频，全部支持原生立体声音频

[MiniMax H3](https://www.minimax.io/blog/minimax-h3) 是 MiniMax 推出的通用全模态生成模型，可通过 MiniMax H3 API 节点在 ComfyUI 中使用。API 工作流在 MiniMax 的服务器上运行生成任务，因此无需下载模型，也不需要本地 GPU，已生成视频的每一秒都会计入你的 Comfy API 账户。

MiniMax H3 可生成带有**原生立体声音频**的视频：人声、音效和音乐会在同一次前向传播中共同建模，而非事后叠加。输出最高支持 2K 分辨率，每个片段时长 5-15 秒。

<Note>
  这些 API 工作流会通过你的 Comfy 账户在 MiniMax 的服务器上运行。如需在自有硬件上本地运行 H3 进行商业用途，你需要获取 [MiniMax 商业许可证](https://comfy.org/minimax/license)，该许可证可通过唯一官方经销商 Comfy 购买。
</Note>

## MiniMax H3 擅长什么

* **原生立体声音频**：人声、音效和音乐与视频在单次前向传播中一起建模，而不是事后叠加
* **高分辨率输出**：每个片段时长为 5-15 秒，分辨率最高可达 2K
* **文生视频**：根据文本提示生成带音频的视频
* **首尾帧视频**：生成首帧与可选尾帧图像之间的运动
* **参考条件生成**：基于最多 9 张参考图像、3 个参考视频和 3 段参考音频生成视频

## 示例输出

通过单个提示词进行文生视频生成，并带有原生立体声音频：

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/api_minimax_h3_t2v.mp4" />

首尾帧生成，由模型创建两个帧之间的运动：

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/api_minimax_h3_flf2v.mp4" />

<Tip>
  使用 API 节点需要保证你已经正常登录，并在受许可的网络环境下使用，请参考[API 节点总览](/zh/tutorials/partner-nodes/overview)部分文档来了解使用 API 节点的具体使用要求。
</Tip>

<Tip>
  <Tabs>
    <Tab title="本地用户">
      请确保你的 ComfyUI 已经更新。

      * [ComfyUI 下载](https://www.comfy.org/download)
      * [ComfyUI 更新教程](/zh/installation/update_comfyui)

      本指南里的工作流可以在[工作流模板](/zh/interface/features/template)中找到。如果找不到，可能是 ComfyUI 没有更新。

      如果加载工作流时有节点缺失，可能原因有：

      1. 你用的不是最新版（每夜版）。
      2. 启动时有些节点导入失败。
    </Tab>

    <Tab title="云端用户">
      * [Cloud](https://cloud.comfy.org) 会在 ComfyUI 稳定版本发布后更新。

      所以，如果你发现本文档中有任何核心节点缺失，可能是因为新核心节点尚未在最新稳定版中发布。请等待下一个稳定版发布。
    </Tab>
  </Tabs>
</Tip>

## MiniMax H3 API 工作流

模板库随附以下三个 API 示例工作流：

* **文生视频**：根据文本提示词生成视频
* **首尾帧视频**：在首帧和末帧图像之间生成视频
* **参考生成视频**：根据参考图像、视频和音频生成视频

### MiniMax H3 文生视频

通过 MiniMax H3 API 从文本提示词生成视频，并输出原生立体声音频。

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/api_minimax_h3_t2v.mp4" />

<CardGroup cols={2}>
  <Card title="在 Comfy Cloud 上运行" icon="cloud" href="https://cloud.comfy.org/?template=api_minimax_h3_t2v&utm_source=docs&utm_medium=referral&utm_campaign=minimax-h3-api">
    在 Comfy Cloud 中打开
  </Card>

  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/api_minimax_h3_t2v.json">
    下载 JSON，或在模板库中搜索“MiniMax H3 T2V”
  </Card>
</CardGroup>

#### 提示词技巧

1. **提示词**：在一个文本块中描述整个场景以及伴随的音频（对白、音效、音乐）
2. **时长**：时长输入支持 5-15 秒；该工作流自带一个快速的 5 秒预览
3. **分辨率和比例**：API 以 2K 分辨率渲染；选择宽高比预设，例如 `16:9`、`9:16` 或 `1:1`
4. **水印**：AIGC 水印默认关闭；如有需要，可在节点的高级设置中启用

#### 提示词编写指南

MiniMax 发布了一份官方的[视频提示词编写指南](https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md)，适用于 T2VA、I2VA、FL2VA 和 L2VA 基础生成模式。该指南解释了如何将提示词组织成按时序排列的镜头，并配合相机运动和音频（对白、音效、音乐），同时为每种模式提供了示例。

### MiniMax H3 首尾帧视频

通过 MiniMax H3 API 在首帧图像和可选末帧图像之间生成视频。输出的宽高比与输入图像保持一致。

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/api_minimax_h3_flf2v.mp4" />

<CardGroup cols={2}>
  <Card title="在 Comfy Cloud 上运行" icon="cloud" href="https://cloud.comfy.org/?template=api_minimax_h3_flf2v&utm_source=docs&utm_medium=referral&utm_campaign=minimax-h3-api">
    在 Comfy Cloud 中打开
  </Card>

  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/api_minimax_h3_flf2v.json">
    下载 JSON，或在模板库中搜索“MiniMax H3 FLF2V”
  </Card>
</CardGroup>

<CardGroup cols={2}>
  <Card title="首帧：angel-warrior-demon-battle-start.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/angel-warrior-demon-battle-start.png">
    工作流的首帧图像，或使用您自己的图像。
  </Card>

  <Card title="末帧：angel-warrior-demon-battle-end.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/angel-warrior-demon-battle-end.png">
    工作流的末帧图像，或使用您自己的图像。
  </Card>
</CardGroup>

#### 提示技巧

1. **帧**：`first_frame` 输入为必填；`last_frame` 为可选。模型会生成两者之间的运动
2. **宽高比**：输出跟随输入图像，因此请保持两帧的宽高比一致
3. **图像约束**：每帧的宽度和高度必须在 256 到 5760 像素之间，宽高比在 2:5 到 5:2 之间
4. **提示词**：描述两帧之间的过渡，以及您想要的音频（对白、音效、音乐）

#### 提示词编写指南

MiniMax 为基础生成模式（T2VA、I2VA、FL2VA 和 L2VA）发布了官方的[视频提示词编写指南](https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md)。该指南解释了如何将提示词组织为带时间轴的镜头，包含相机运镜和音频（对白、音效、音乐），并为每种模式提供了示例。

### MiniMax H3 参考转视频

通过 MiniMax H3 API，以参考图像、视频和音频作为条件生成视频。

![MiniMax H3 参考转视频工作流预览](https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/api_minimax_h3_r2v-1.webp)

<CardGroup cols={2}>
  <Card title="在 Comfy Cloud 上运行" icon="cloud" href="https://cloud.comfy.org/?template=api_minimax_h3_r2v&utm_source=docs&utm_medium=referral&utm_campaign=minimax-h3-api">
    在 Comfy Cloud 中打开
  </Card>

  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/api_minimax_h3_r2v.json">
    下载 JSON，或在模板库中搜索“MiniMax H3 R2V”
  </Card>
</CardGroup>

<CardGroup cols={1}>
  <Card title="参考图像：9panel_storyboard_golden_hour_clay_court.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/9panel_storyboard_golden_hour_clay_court.png">
    该工作流的分镜参考图，也可以使用你自己的图像。
  </Card>
</CardGroup>

#### 提示词技巧

1. **按标签引用**：在提示词中按顺序引用每个输入，例如 `Image 1`、`Video 1` 或 `Audio 1`。
2. **限制**：最多 9 张参考图像、3 个参考视频和 3 段参考音频。每个视频或音频片段必须为 2–15 秒；参考视频与参考音频的总时长上限均为 15 秒。
3. **音频需要视觉锚点**：如果没有至少一个参考图像或参考视频，就无法使用参考音频。
4. **视频要求**：参考视频的帧率必须为 23.976–60 FPS。
5. **提示词**：为每个参考内容分配一个任务（身份、风格、动作、声音），并描述目标镜头；明确的分配通常效果要好得多。

#### 提示词编写指南

MiniMax 为参考驱动生成（R2V）发布了一份官方的 [全参考模式提示词编写指南](https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md)。该指南涵盖改写输出的结构，包括主体定义、参考标签和保留度分析，以及如何为每个参考内容在目标镜头中分配角色。
