Skip to main content
이 노드는 이미지와 텍스트를 인코딩하여 학습 데이터를 준비합니다. 이미지 목록과 이에 대응하는 텍스트 캡션 목록을 입력받은 후, VAE 모델을 사용하여 이미지를 잠재 표현(latent representation)으로 변환하고 CLIP 모델을 사용하여 텍스트를 컨디셔닝 데이터로 변환합니다. 결과적으로 생성된 잠재 표현과 컨디셔닝은 목록으로 출력되며, 학습 워크플로우에서 바로 사용할 수 있습니다.

입력

매개변수 제약사항:
  • texts 목록의 항목 수는 0, 1 또는 images 목록의 항목 수와 정확히 일치해야 합니다. 0인 경우 모든 이미지에 빈 문자열이 사용됩니다. 1인 경우 해당 단일 텍스트가 모든 이미지에 반복됩니다. 다른 길이는 오류를 발생시킵니다.
  • 출력 latentsconditioning 목록은 항상 images 목록과 동일한 항목 수를 포함하므로, 각 잠재 표현은 해당 캡션의 컨디셔닝과 짝을 이룹니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 244adc98810a874cfe42f834e89f96da300d883faeb5791dff19607c13d0c0db