Skip to main content

概要

このノードは、Causal Forcing または Self-Forcing を使用する AR(Auto-Regressive、自己回帰)ビデオモデル向けに、画像からビデオを生成するセットアップを準備します。開始画像を VAE で潜在空間にエンコードし、それをモデルのトランスフォーマーオプションに保存することで、ビデオサンプリングプロセスがデノイジング前に KV キャッシュをシードできるようにします。同じテキストからビデオへのモデルチェックポイントを使用するため、画像からビデオへの専用アーキテクチャは不要です。

入力

注: 開始画像はエンコード前に指定された widthheight にリサイズされます。潜在空間の時間次元は ((length - 1) // 4) + 1 として計算され、潜在空間の空間次元は height / 8width / 8 になります。

出力

このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): 984834951b9d5a22aef51c85a5019fd8ba58cdb2d6fff235371ed29f316896d8