输入
注意: 两个输入的样本会以嵌套张量中的视频流和音频流对的形式组合在一起。如果任一输入包含
noise_mask,输出将包含合并后的掩码;缺失的掩码会替换为与其样本形状匹配的全 1 掩码。当较短的音频被填充时,填充区域保持未掩码状态,以便模型生成该区域。如果音频潜空间无法适配到视频潜空间,节点会报错,例如当两个潜空间在多个维度上不同,或在批次或通道维度上不同时。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
0231f9db2ce73132d8555fbb33f295b68aa68a0c1c54e4a0c5d2e1f67b5611cb