Skip to main content
WanSCAILToVideo 노드는 SCAIL 및 SCAIL-2 비디오 모델을 사용한 비디오 생성을 위해 컨디셔닝과 빈 잠재 공간을 준비합니다. 참조 이미지, 포즈 비디오, CLIP 비전 출력, 색상 ID 마스크, 이전 프레임 청크와 같은 선택적 입력을 처리하여 포지티브 및 네거티브 컨디셔닝에 임베딩합니다. 이 노드는 수정된 컨디셔닝과 지정된 비디오 크기의 빈 잠재 텐서를 출력하여 샘플링 준비를 마칩니다.

입력

참고: pose_videopose_video_mask 입력은 둘 중 더 짧은 길이에 맞춰 함께 잘리며, 처음 length 프레임에 대해서만 처리됩니다. 두 입력 중 하나라도 video_frame_offset보다 짧거나 같으면 해당 입력은 완전히 무시됩니다. pose_video는 인코딩 전에 주 비디오 해상도의 절반으로 축소되며, 인코딩된 포즈 잠재는 pose_strength만큼 곱해져서 pose_startpose_end 타임스텝 단계 사이에서만 컨디셔닝에 적용됩니다. pose_video_mask가 제공되면 색상 마스크 비디오는 절반 해상도로 축소되고 28채널 드라이빙 마스크로 변환되어 포지티브 및 네거티브 컨디셔닝에 모두 추가됩니다. 참고: reference_image가 제공되면 배치의 각 이미지는 개별적으로 잠재로 인코딩되어 포지티브 및 네거티브 컨디셔닝에 모두 임베딩됩니다. 첫 번째 이미지는 기본 참조이며, 추가 이미지는 추가 뷰로 사용되며 각각 일치하는 reference_image_mask가 필요합니다. reference_image_maskreference_image도 함께 제공될 때만 사용됩니다. 둘 다 제공되면 참조 프레임을 ID에 바인딩하는 28채널 참조 마스크가 마스크들로부터 생성되어 컨디셔닝에 추가됩니다. 교체 모드(replacement_mode=True)에서는 참조 이미지가 reference_image_mask를 알파 매트로 사용하여 검은 배경에 합성됩니다. clip_vision_output이 제공되면 포지티브 및 네거티브 컨디셔닝에 모두 적용됩니다. 참고: previous_frames가 제공되면 마지막 previous_frame_count 프레임만 확장 앵커로 사용되며, video_frame_offset도 그에 따라 조정됩니다(앵커링된 프레임 수만큼 감소하며, 최소 0으로 제한됩니다). 앵커링된 프레임은 인코딩되어 출력 잠재의 시작 부분에 기록되며, 생성 중 해당 프레임이 변경되지 않도록 노이즈 마스크가 포함됩니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 4a1a2201dfa94bd2f1330db02ec18a5e0a6aae9e9ac5ae97d456b7af1aa84b7b