输入
注意: 当提供参考图像时,它会被编码为潜在表示并附加到正向 conditioning 上,同时一个形状相同的零填充潜在表示会被附加到负向 conditioning 上。当提供音频编码器输出时,音频嵌入会被插值并附加到正向 conditioning 上,同时一个零填充的音频嵌入会被附加到负向 conditioning 上。如果省略可选输入,则参考潜在表示和音频嵌入均使用零填充的占位张量。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
db674a4a00729a8715988030083e2858f958cd21de73bbbe4ed6d76f5f539419