入力
注記:
start_image が指定された場合、画像シーケンスはターゲットの width と height にアップスケールされ、VAEでエンコードされて、潜在表現の先頭フレームに配置されます。それらのフレームのノイズマスクは0(保持)に設定され、残りのフレームのマスク値は1(ノイズ除去対象)になります。潜在表現は常に48チャンネルを持ち、空間次元は height / 16 × width / 16、時間次元は ((length - 1) // 4) + 1 です。width と height は16で割り切れる必要があり(ステップ32により強制)、length は時間次元を4ステップで増加させます。
出力
両方のフィールドは、単一のLATENT出力内にまとめて返されます。
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集
Source fingerprint (SHA-256):
3d05980641eeef2e86df7a845aa8b2bd703882db98fe71adef2746ab34a9d717