입력
참고: VAE가 제공되면 노드는 제공된 모든 입력 이미지에서 참조 잠재 변수를 생성합니다. 최대 세 개의 이미지를 한 번에 처리할 수 있습니다. 이미지는 비전-언어 처리를 위해 384x384 픽셀의 목표 영역으로 크기가 조정되며(가로 세로 비율 유지), VAE 인코딩을 위해 8로 나누어 떨어지는 크기(1024x1024 픽셀 목표 영역)로 조정됩니다.
출력
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집
Source fingerprint (SHA-256):
5eea53a84045924b44d445244e6149b341188d22573aaaced87bac8a139dac96