入力
注:
clip_vision_output は、完全な隠れ状態と最後から2番目の隠れ状態を提供する CLIP vision モデルから取得する必要があります。ノードは、最後から20番目、最後から11番目、および最後から2番目の隠れ状態を組み合わせてスタイル埋め込みを生成します。model_patch は、その model 属性を通じてプロジェクションモデルを公開する必要があり、このプロジェクションモデルがこれらの画像特徴量をスタイル埋め込みに変換します。サンプリング中、スタイル埋め込みはテキストコンディショニングの先頭に付加され、生成に影響を与えることができます。
出力
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集
Source fingerprint (SHA-256):
9033dddb76fafb388c67dcd09d96102a7ab3e5bc416cec61bf18d088da37a0f0