Skip to main content
LTXV 参考音频功能可将参考音频片段中的说话人身份特征迁移到生成的音频中。该节点会将参考音频编码到 conditioning 中,并可选地使用身份引导对模型进行补丁处理,即在每一步额外执行一次不包含参考音频的前向传播,以增强说话人身份特征的效果。

输入

注意:仅当 identity_guidance_scale 大于 0 且当前采样步骤处于 start_percentend_percent 定义的范围内时,才会应用身份引导。如果参考音频的采样率与音频 VAE 的采样率不同,参考音频会被重新采样。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): ae15c5838656324667d099614b325b863341f05afda43054658999574522dd49