入力
注:
pose_video と pose_video_mask の入力は、2つのうち短い方に合わせて切り詰められ、最初の length フレームについてのみ処理されます。どちらかの入力が video_frame_offset 以下である場合、その入力は完全に無視されます。pose_video はエンコード前にメインビデオの半分の解像度にダウンスケールされ、エンコードされたポーズ潜在表現は pose_strength で乗算され、pose_start から pose_end のタイムステップ間でのみ条件付けに適用されます。pose_video_mask が指定された場合、色分けされたマスクビデオは半分の解像度にダウンスケールされ、28チャンネルのドライビングマスクに変換され、ポジティブとネガティブの両方の条件付けに追加されます。
注: reference_image が指定されると、バッチ内の各画像は個別に潜在表現にエンコードされ、ポジティブとネガティブの両方の条件付けに埋め込まれます。最初の画像はプライマリ参照です。追加の画像は追加ビューとして使用され、それぞれに対応する reference_image_mask が必要です。reference_image_mask は reference_image も指定されている場合にのみ使用されます。両方が指定された場合、参照フレームをIDにバインドする28チャンネルの参照マスクもマスクから構築され、条件付けに追加されます。置換モード(replacement_mode=True)では、参照画像は参照画像マスクをアルファマットとして使用して黒い背景に合成されます。clip_vision_output が指定された場合、それはポジティブとネガティブの両方の条件付けに適用されます。
注: previous_frames が指定された場合、最後の previous_frame_count フレームのみが拡張アンカーとして使用され、video_frame_offset はそれに応じて調整されます(アンカーされたフレーム数だけ減算され、0でクランプされます)。アンカーされたフレームはエンコードされて出力潜在表現の先頭に書き込まれ、生成中にそれらのフレームが変更されないようにノイズマスクが含められます。
出力
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集
Source fingerprint (SHA-256):
4a1a2201dfa94bd2f1330db02ec18a5e0a6aae9e9ac5ae97d456b7af1aa84b7b