Skip to main content
Google Geminiは、Googleが開発した強力なAIモデルで、会話機能とテキスト生成機能をサポートしています。現在、ComfyUIはGoogle Gemini APIを統合しており、ComfyUI内の関連ノードを直接使用して会話機能を実現できます。

Google Gemini が得意なこと

  • 会話とテキスト生成:ComfyUI ワークフロー内で直接 Google のマルチモーダル AI とチャットできます
  • マルチモーダル推論:Gemini の推論機能を使用して画像を解釈できます
  • 画像からプロンプトへの変換:公式テンプレートには、画像を対応する描画プロンプトに変換するプロンプトが付属しています
  • 複数画像の入力画像をバッチ処理 を使用すると、1回の実行で複数の画像をAIに送信して解釈させることができます
APIノードを使用するには、正しくログインしていることと、許可されたネットワーク環境で使用していることを確認する必要があります。APIノードの使用に必要な具体的な要件については、ドキュメントの「APIノードの概要」セクションをご参照ください。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している

Google Gemini

Geminiの推論能力でGoogleのマルチモーダルAIを体験しましょう。

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで”Google Gemini”を検索
入力素材 このファイルを対応するLoadImageノードにアップロードしてください:

example.png

LoadImageノード 2 · example.png

ワークフローの実行をステップバイステップで完了する

対応するテンプレートでは、画像を対応する描画プロンプトに解釈するために、役割プロンプトを分析・生成するプロンプトを構築しています。
画像内の番号を参照して、基本的なテキストから画像へのワークフロー実行を完了できます:
  1. Load Image ノードで、AIに解釈させたい画像を読み込みます
  2. (任意)必要に応じて、Google Gemini のプロンプトを変更して、AIに特定のタスクを実行させることができます
  3. Run ボタンをクリックするか、ショートカット Ctrl(cmd) + Enter を使用して会話を実行します。
  4. APIが結果を返すのを待った後、Preview Any ノードでAIが返した対応するコンテンツを表示できます。

補足

  • 現在、ファイル入力ノードGemini入力ファイルは、ファイルを先にComfyUI/input/ディレクトリへアップロードする必要があります。このノードは改善中であり、更新後にテンプレートを修正します。
  • このワークフローは、入力に画像をバッチ処理を使用した例を示しています。AIによる解釈が必要な画像が複数ある場合は、ステップ図を参照し、右クリックで対応するノードのモードをAlwaysに設定して有効にできます。