Skip to main content
Google Gemini는 Google에서 개발한 강력한 AI 모델로, 대화 및 텍스트 생성 기능을 지원합니다. 현재 ComfyUI는 Google Gemini API를 통합하여 ComfyUI에서 관련 노드를 직접 사용해 대화 기능을 수행할 수 있습니다.

Google Gemini가 잘하는 것

  • 대화 및 텍스트 생성: ComfyUI 워크플로 내에서 직접 Google의 멀티모달 AI와 대화할 수 있습니다.
  • 멀티모달 추론: Gemini의 추론 기능으로 이미지를 해석합니다.
  • 이미지-프롬프트 해석: 공식 템플릿에는 이미지를 해당하는 그림 프롬프트로 변환하는 프롬프트가 포함되어 있습니다.
  • 다중 이미지 입력: 이미지 배치를 사용하면 한 번의 실행으로 여러 이미지를 AI 해석에 보낼 수 있습니다.
파트너 노드를 사용하려면 올바르게 로그인되어 있고 허가된 네트워크 환경을 사용하고 있는지 확인해야 합니다. 파트너 노드를 사용하기 위한 구체적인 요구사항은 문서의 파트너 노드 개요 섹션을 참조해 주세요.
ComfyUI가 최신 버전으로 업데이트되었는지 확인하세요.이 가이드의 워크플로는 워크플로 템플릿에서 확인할 수 있습니다. 템플릿에서 찾을 수 없다면, 귀하의 ComfyUI가 오래된 버전일 수 있습니다.워크플로를 로드할 때 노드가 누락되는 경우, 가능한 원인:
  1. 최신 ComfyUI 버전(최신 테스트 버전(nightly))을 사용하고 있지 않음
  2. 일부 노드가 시작 시 가져오기에 실패함

Google Gemini

Gemini의 추론 기능으로 Google의 멀티모달 AI를 경험해 보세요.

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON 다운로드 또는 템플릿 라이브러리에서 “Google Gemini” 검색
입력 자료 이 파일을 해당 LoadImage 노드에 업로드하세요:

example.png

LoadImage 노드 2 · example.png

워크플로 실행을 단계별로 완료하기

해당 템플릿에는 역할 프롬프트를 분석하고 생성하기 위한 프롬프트가 내장되어 있으며, 이를 통해 이미지를 해당 드로잉 프롬프트로 해석합니다.
이미지의 번호를 참조하여 기본 텍스트 기반 이미지 생성 워크플로 실행을 완료할 수 있습니다:
  1. Load Image 노드에서 AI가 해석해야 할 이미지를 로드합니다.
  2. (선택 사항) 필요한 경우 Google Gemini의 프롬프트를 수정하여 AI가 특정 작업을 실행하도록 할 수 있습니다.
  3. Run 버튼을 클릭하거나 단축키 Ctrl(cmd) + Enter를 사용하여 대화를 실행합니다.
  4. API가 결과를 반환할 때까지 기다린 후, Preview Any 노드에서 AI가 반환한 해당 콘텐츠를 확인할 수 있습니다.

추가 참고 사항

  • 현재 파일 입력 노드 Gemini Input Files는 파일을 먼저 ComfyUI/input/ 디렉토리에 업로드해야 합니다. 이 노드는 개선 중이며, 업데이트 이후 템플릿을 수정할 예정입니다.
  • 워크플로는 입력에 Batch Images를 사용하는 예시를 제공합니다. AI 해석이 필요한 이미지가 여러 개인 경우, 단계 다이어그램을 참조하고 마우스 오른쪽 버튼을 클릭하여 해당 노드 모드를 Always로 설정하면 활성화할 수 있습니다.