Skip to main content
WanInfiniteTalkToVideo 根据音频输入生成视频序列。它使用视频扩散模型,以从一个或两个说话人提取的音频特征为条件,生成说话人头部视频的潜在表示。该节点可以生成新序列,或使用先前帧作为运动上下文来扩展现有序列。

输入

通用输入

双说话人输入

mode 设置为 "two_speakers" 时,将显示此部分中的输入。 参数约束:
  • mode 设置为 "two_speakers" 时,对于第二个说话人设置,audio_encoder_output_2mask_1mask_2 为必填项。
  • 如果提供了 audio_encoder_output_2,则还必须提供 mask_1mask_2
  • 如果同时提供了 mask_1mask_2,则还必须提供 audio_encoder_output_2
  • 如果提供了 previous_frames,则其帧数必须至少达到 motion_frame_count 指定的数量。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): b7359490c1de86d9c82122bc227295b3b7f8a3493f629365ae0f22f9f34d9a66