Skip to main content
LTXV Reference Audio는 참조 오디오 클립에서 화자의 음성 정체성을 추출하여 생성된 오디오에 이전합니다. 참조 오디오를 컨디셔닝에 인코딩하고, 선택적으로 정체성 가이던스로 모델을 패치하여 각 단계에서 참조 없이 추가 전방 패스를 실행함으로써 화자 정체성 효과를 증폭시킵니다.

입력

참고: 정체성 가이던스는 identity_guidance_scale이 0보다 크고 현재 샘플링 단계가 start_percentend_percent로 정의된 범위 내에 있을 때만 적용됩니다. 참조 오디오의 샘플 레이트가 오디오 VAE의 샘플 레이트와 다를 경우, 참조 오디오가 해당 샘플 레이트로 리샘플링됩니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): ae15c5838656324667d099614b325b863341f05afda43054658999574522dd49