입력
참고:
start_image가 제공되면 이미지 시퀀스는 목표 width 및 height로 업스케일되고, VAE를 통해 인코딩된 후 잠재의 첫 번째 프레임에 배치됩니다. 해당 프레임의 노이즈 마스크는 0(보존됨)으로 설정되고, 나머지 프레임의 마스크 값은 1(노이즈 제거 대상)입니다. 잠재는 항상 48개의 채널과 height / 16 × width / 16의 공간 차원, 그리고 ((length - 1) // 4) + 1의 시간적 차원을 가집니다. width와 height는 16으로 나누어떨어져야 하며(32 단계로 강제됨), length는 시간적 차원을 4 단계로 증가시킵니다.
출력
두 필드는 단일 LATENT 출력 안에 함께 반환됩니다.
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집
Source fingerprint (SHA-256):
3d05980641eeef2e86df7a845aa8b2bd703882db98fe71adef2746ab34a9d717