Skip to main content
WanInfiniteTalkToVideoは、音声入力からビデオシーケンスを生成します。1人または2人の話者から抽出された音声特徴を条件として、ビデオ拡散モデルを使用し、トーキングヘッドビデオの潜在表現を生成します。このノードは、新しいシーケンスを生成するか、モーションコンテキストとして以前のフレームを使用して既存のシーケンスを拡張できます。

入力

共通入力

2人話者入力

このセクションの入力は、mode"two_speakers" に設定されている場合に表示されます。 パラメータ制約:
  • mode"two_speakers" に設定されている場合、2番目の話者のセットアップには audio_encoder_output_2mask_1mask_2 が必要です。
  • audio_encoder_output_2 が提供される場合、mask_1mask_2 の両方も提供する必要があります。
  • mask_1mask_2 の両方が提供される場合、audio_encoder_output_2 も提供する必要があります。
  • previous_frames が提供される場合、motion_frame_count で指定されたフレーム数以上のフレームが含まれている必要があります。

出力

このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): b7359490c1de86d9c82122bc227295b3b7f8a3493f629365ae0f22f9f34d9a66