入力
注: 両方の入力からのサンプルは、ネストされたテンソル内でビデオストリームとオーディオストリームのペアとして結合されます。いずれかの入力に
noise_mask が含まれている場合、出力には結合されたマスクが含まれます。欠落しているマスクは、そのサンプルの形状に一致するすべてが1のマスクに置き換えられます。短いオーディオがパディングされた場合、パディングされた領域はマスクされずに残され、モデルがその領域を生成できるようになります。オーディオ潜在表現をビデオ潜在表現に適合できない場合、たとえば2つの潜在表現が複数の次元で異なる場合や、バッチ次元またはチャンネル次元で異なる場合、ノードはエラーを発生させます。
出力
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集
Source fingerprint (SHA-256):
0231f9db2ce73132d8555fbb33f295b68aa68a0c1c54e4a0c5d2e1f67b5611cb