Skip to main content
Wan22ImageToVideoLatent 노드는 이미지에서 비디오 잠재 표현을 생성합니다. 지정된 너비, 높이, 프레임 길이 및 배치 크기로 빈 비디오 잠재 공간을 생성하며, 선택적으로 시작 이미지 시퀀스를 비디오의 시작 프레임에 인코딩할 수 있습니다. 시작 이미지가 제공되면 이 노드는 해당 이미지를 잠재 공간으로 인코딩하고, 생성 중 노이즈 제거가 필요한 영역을 표시하는 노이즈 마스크를 함께 생성합니다.

입력

참고: start_image가 제공되면 이미지 시퀀스는 목표 widthheight로 업스케일되고, VAE를 통해 인코딩된 후 잠재의 첫 번째 프레임에 배치됩니다. 해당 프레임의 노이즈 마스크는 0(보존됨)으로 설정되고, 나머지 프레임의 마스크 값은 1(노이즈 제거 대상)입니다. 잠재는 항상 48개의 채널과 height / 16 × width / 16의 공간 차원, 그리고 ((length - 1) // 4) + 1의 시간적 차원을 가집니다. widthheight는 16으로 나누어떨어져야 하며(32 단계로 강제됨), length는 시간적 차원을 4 단계로 증가시킵니다.

출력

두 필드는 단일 LATENT 출력 안에 함께 반환됩니다.
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 3d05980641eeef2e86df7a845aa8b2bd703882db98fe71adef2746ab34a9d717