입력
참고:
clip_vision_output은 전체 은닉 상태와 끝에서 두 번째 은닉 상태를 제공하는 CLIP 비전 모델에서 얻어야 합니다. 이 노드는 끝에서 20번째, 끝에서 11번째, 그리고 끝에서 두 번째 은닉 상태를 결합하여 스타일 임베딩을 생성합니다. model_patch는 model 속성을 통해 이러한 이미지 특징을 스타일 임베딩으로 변환하는 프로젝션 모델을 노출해야 합니다. 샘플링 중에 스타일 임베딩은 텍스트 컨디셔닝 앞에 추가되어 생성에 영향을 줄 수 있습니다.
출력
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집
Source fingerprint (SHA-256):
9033dddb76fafb388c67dcd09d96102a7ab3e5bc416cec61bf18d088da37a0f0