Skip to main content
WanInfiniteTalkToVideo는 오디오 입력으로부터 비디오 시퀀스를 생성합니다. 하나 또는 두 명의 화자에게서 추출한 오디오 특징을 조건으로 하는 비디오 확산 모델을 사용하여 토킹 헤드 비디오의 잠재 표현을 생성합니다. 이 노드는 새 시퀀스를 생성하거나 이전 프레임을 모션 컨텍스트로 사용하여 기존 시퀀스를 확장할 수 있습니다.

입력

공통 입력

두 화자 입력

이 섹션의 입력은 mode"two_speakers"로 설정된 경우 표시됩니다. 매개변수 제약 조건:
  • mode"two_speakers"로 설정된 경우 두 번째 화자 설정에 audio_encoder_output_2, mask_1, mask_2가 필요합니다.
  • audio_encoder_output_2가 제공되면 mask_1mask_2도 모두 제공되어야 합니다.
  • mask_1mask_2가 모두 제공되면 audio_encoder_output_2도 제공되어야 합니다.
  • previous_frames가 제공되면 motion_frame_count에 지정된 프레임 수 이상을 포함해야 합니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): b7359490c1de86d9c82122bc227295b3b7f8a3493f629365ae0f22f9f34d9a66