입력
참고: 참조 이미지가 제공되면 해당 이미지는 잠재 표현으로 인코딩되어 긍정 컨디셔닝에 첨부되고, 동일한 형태의 0으로 채워진 잠재 표현이 부정 컨디셔닝에 첨부됩니다. 오디오 인코더 출력이 제공되면 오디오 임베딩은 보간되어 긍정 컨디셔닝에 첨부되고, 0으로 채워진 오디오 임베딩이 부정 컨디셔닝에 첨부됩니다. 선택적 입력이 생략되면 참조 잠재 표현과 오디오 임베딩 모두에 대해 0으로 채워진 플레이스홀더 텐서가 사용됩니다.
출력
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집
Source fingerprint (SHA-256):
db674a4a00729a8715988030083e2858f958cd21de73bbbe4ed6d76f5f539419