Skip to main content
Wan22ImageToVideoLatent は、画像からビデオの潜在表現を生成します。指定された幅、高さ、フレーム長、バッチサイズで空白のビデオ潜在空間を生成し、オプションで開始画像シーケンスを先頭フレームにエンコードできます。開始画像が指定されると、ノードはそれを潜在空間にエンコードし、生成中にどの領域をノイズ除去すべきかを示す対応するノイズマスクを作成します。

入力

注記: start_image が指定された場合、画像シーケンスはターゲットの widthheight にアップスケールされ、VAEでエンコードされて、潜在表現の先頭フレームに配置されます。それらのフレームのノイズマスクは0(保持)に設定され、残りのフレームのマスク値は1(ノイズ除去対象)になります。潜在表現は常に48チャンネルを持ち、空間次元は height / 16 × width / 16、時間次元は ((length - 1) // 4) + 1 です。widthheight は16で割り切れる必要があり(ステップ32により強制)、length は時間次元を4ステップで増加させます。

出力

両方のフィールドは、単一のLATENT出力内にまとめて返されます。
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): 3d05980641eeef2e86df7a845aa8b2bd703882db98fe71adef2746ab34a9d717