输入
注意:
pose_video 和 pose_video_mask 输入会一起被截断到两者中较短的长度,并且仅对前 length 帧进行处理。如果任一输入的长度小于或等于 video_frame_offset,则完全忽略该输入。pose_video 在编码前会被缩小到主视频分辨率的一半;编码后的姿态潜空间会乘以 pose_strength,并且仅在 pose_start 到 pose_end 之间的时间步内应用于条件。如果提供了 pose_video_mask,彩色掩码视频会被缩小到一半分辨率,并转换为 28 通道驱动掩码,该掩码会同时添加到正向和负向条件中。
注意: 当提供 reference_image 时,批次中的每张图像都会单独编码为一个潜空间,并嵌入到正向和负向条件中。第一张图像是主要参考;附加图像用作附加视角,每张都需要一个匹配的 reference_image_mask。reference_image_mask 仅在同时提供 reference_image 时使用;当两者都提供时,还会根据这些掩码构建一个 28 通道参考掩码,用于将参考帧与身份绑定,并添加到条件中。在替换模式(replacement_mode=True)下,参考图像会以参考图像掩码作为 alpha 遮罩合成到黑色背景上。当提供 clip_vision_output 时,它会同时应用到正向和负向条件中。
注意: 当提供 previous_frames 时,仅使用最后 previous_frame_count 帧作为扩展锚点,并且 video_frame_offset 会相应调整(减去已锚定的帧数,下限为 0)。锚定的帧会被编码并写入输出潜空间的开头,同时包含一个噪声掩码,以便在生成过程中保持这些帧不变。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
4a1a2201dfa94bd2f1330db02ec18a5e0a6aae9e9ac5ae97d456b7af1aa84b7b