> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-custom-nodes-sdk-v2-frontend.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# WanInfiniteTalkToVideo - ComfyUI Built-in Node Documentation

> WanInfiniteTalkToVideo는 오디오 입력으로부터 비디오 시퀀스를 생성합니다. 하나 또는 두 명의 화자에게서 추출한 오디오 특징을 조건으로 하는 비디오 확산 모델을 사용하여 토킹 헤드 비디오의 잠재 표현을 생성합니다. 이 노드는 새 시퀀스를 생성하거나 이전 프레임을 모션 컨텍스트로 사용하여 기존 시퀀스를 확장

WanInfiniteTalkToVideo는 오디오 입력으로부터 비디오 시퀀스를 생성합니다. 하나 또는 두 명의 화자에게서 추출한 오디오 특징을 조건으로 하는 비디오 확산 모델을 사용하여 토킹 헤드 비디오의 잠재 표현을 생성합니다. 이 노드는 새 시퀀스를 생성하거나 이전 프레임을 모션 컨텍스트로 사용하여 기존 시퀀스를 확장할 수 있습니다.

## 입력

### 공통 입력

| 매개변수                     | 설명                                                                                                         | 데이터 타입                 | 필수 여부 | 범위                                       |
| ------------------------ | ---------------------------------------------------------------------------------------------------------- | ---------------------- | ----- | ---------------------------------------- |
| `mode`                   | 오디오 입력 모드입니다. `single_speaker`는 하나의 오디오 입력을 사용합니다. `two_speakers`는 두 화자 입력 섹션에 나열된 추가 오디오 입력과 마스크를 활성화합니다. | DYNAMIC\_COMBO         | 예     | `"single_speaker"`<br />`"two_speakers"` |
| `model`                  | 기본 비디오 확산 모델입니다.                                                                                           | MODEL                  | 예     | -                                        |
| `model_patch`            | 오디오 프로젝션 레이어를 포함하는 모델 패치입니다.                                                                               | MODEL\_PATCH           | 예     | -                                        |
| `positive`               | 생성을 안내하는 포지티브 컨디셔닝입니다.                                                                                     | CONDITIONING           | 예     | -                                        |
| `negative`               | 생성을 안내하는 네거티브 컨디셔닝입니다.                                                                                     | CONDITIONING           | 예     | -                                        |
| `vae`                    | 이미지를 잠재 공간으로 인코딩하고 잠재 공간에서 복원하는 데 사용되는 VAE입니다.                                                             | VAE                    | 예     | -                                        |
| `width`                  | 출력 비디오의 가로 크기(픽셀)입니다. 16으로 나누어 떨어져야 합니다. (기본값: 832)                                                        | INT                    | 예     | 16 - MAX\_RESOLUTION (step 16)           |
| `height`                 | 출력 비디오의 세로 크기(픽셀)입니다. 16으로 나누어 떨어져야 합니다. (기본값: 480)                                                        | INT                    | 예     | 16 - MAX\_RESOLUTION (step 16)           |
| `length`                 | 생성할 프레임 수입니다. (기본값: 81)                                                                                    | INT                    | 예     | 1 - MAX\_RESOLUTION (step 4)             |
| `clip_vision_output`     | 추가 컨디셔닝을 위한 선택적 CLIP 비전 출력입니다.                                                                             | CLIP\_VISION\_OUTPUT   | 아니요   | -                                        |
| `start_image`            | 비디오 시퀀스를 초기화하는 선택적 시작 이미지입니다.                                                                              | IMAGE                  | 아니요   | -                                        |
| `audio_encoder_output_1` | 첫 번째 화자에 대한 특징을 포함하는 기본 오디오 인코더 출력입니다.                                                                     | AUDIO\_ENCODER\_OUTPUT | 예     | -                                        |
| `motion_frame_count`     | 모션 컨텍스트로 사용할 이전 프레임 수입니다. (기본값: 9)                                                                         | INT                    | 예     | 1 - 33                                   |
| `audio_scale`            | 오디오 컨디셔닝에 적용되는 스케일링 요소입니다. (기본값: 1.0)                                                                      | FLOAT                  | 예     | -10.0 - 10.0                             |
| `previous_frames`        | 확장에 사용할 선택적 이전 비디오 프레임입니다. 마지막 `motion_frame_count` 프레임이 모션 컨텍스트로 사용됩니다.                                   | IMAGE                  | 아니요   | -                                        |

### 두 화자 입력

이 섹션의 입력은 `mode`가 `"two_speakers"`로 설정된 경우 표시됩니다.

| 매개변수                     | 설명                                           | 데이터 타입                 | 필수 여부 | 범위 |
| ------------------------ | -------------------------------------------- | ---------------------- | ----- | -- |
| `audio_encoder_output_2` | 두 번째 화자에 대한 특징을 포함하는 두 번째 오디오 인코더 출력입니다.     | AUDIO\_ENCODER\_OUTPUT | 아니요   | -  |
| `mask_1`                 | 첫 번째 화자용 마스크입니다. 두 개의 오디오 입력을 사용하는 경우 필요합니다. | MASK                   | 아니요   | -  |
| `mask_2`                 | 두 번째 화자용 마스크입니다. 두 개의 오디오 입력을 사용하는 경우 필요합니다. | MASK                   | 아니요   | -  |

**매개변수 제약 조건:**

* `mode`가 `"two_speakers"`로 설정된 경우 두 번째 화자 설정에 `audio_encoder_output_2`, `mask_1`, `mask_2`가 필요합니다.
* `audio_encoder_output_2`가 제공되면 `mask_1`과 `mask_2`도 모두 제공되어야 합니다.
* `mask_1`과 `mask_2`가 모두 제공되면 `audio_encoder_output_2`도 제공되어야 합니다.
* `previous_frames`가 제공되면 `motion_frame_count`에 지정된 프레임 수 이상을 포함해야 합니다.

## 출력

| 출력 이름        | 설명                                                                                                          | 데이터 타입       |
| ------------ | ----------------------------------------------------------------------------------------------------------- | ------------ |
| `model`      | 오디오 컨디셔닝이 적용된 패치된 모델입니다.                                                                                    | MODEL        |
| `positive`   | 시작 이미지나 CLIP 비전 출력과 같은 추가 컨텍스트로 수정될 수 있는 포지티브 컨디셔닝입니다.                                                      | CONDITIONING |
| `negative`   | 추가 컨텍스트로 수정될 수 있는 네거티브 컨디셔닝입니다.                                                                             | CONDITIONING |
| `latent`     | 잠재 공간에서 생성된 비디오 시퀀스입니다.                                                                                     | LATENT       |
| `trim_image` | 시퀀스 확장 시 모션 컨텍스트의 시작 부분에서 잘라내야 하는 프레임 수입니다. `previous_frames`가 제공되면 `motion_frame_count`와 같고, 그렇지 않으면 0입니다. | INT          |

> 이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/WanInfiniteTalkToVideo/ko.md)

***

**Source fingerprint (SHA-256):** `b7359490c1de86d9c82122bc227295b3b7f8a3493f629365ae0f22f9f34d9a66`
