这些 API 工作流会通过你的 Comfy 账户在 MiniMax 的服务器上运行。如需在自有硬件上本地运行 H3 进行商业用途,你需要获取 MiniMax 商业许可证,该许可证可通过唯一官方经销商 Comfy 购买。
MiniMax H3 擅长什么
- 原生立体声音频:人声、音效和音乐与视频在单次前向传播中一起建模,而不是事后叠加
- 高分辨率输出:每个片段时长为 5-15 秒,分辨率最高可达 2K
- 文生视频:根据文本提示生成带音频的视频
- 首尾帧视频:生成首帧与可选尾帧图像之间的运动
- 参考条件生成:基于最多 9 张参考图像、3 个参考视频和 3 段参考音频生成视频
示例输出
通过单个提示词进行文生视频生成,并带有原生立体声音频: 首尾帧生成,由模型创建两个帧之间的运动:MiniMax H3 API 工作流
模板库随附以下三个 API 示例工作流:- 文生视频:根据文本提示词生成视频
- 首尾帧视频:在首帧和末帧图像之间生成视频
- 参考生成视频:根据参考图像、视频和音频生成视频
MiniMax H3 文生视频
通过 MiniMax H3 API 从文本提示词生成视频,并输出原生立体声音频。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 T2V”
提示词技巧
- 提示词:在一个文本块中描述整个场景以及伴随的音频(对白、音效、音乐)
- 时长:时长输入支持 5-15 秒;该工作流自带一个快速的 5 秒预览
- 分辨率和比例:API 以 2K 分辨率渲染;选择宽高比预设,例如
16:9、9:16或1:1 - 水印:AIGC 水印默认关闭;如有需要,可在节点的高级设置中启用
提示词编写指南
MiniMax 发布了一份官方的视频提示词编写指南,适用于 T2VA、I2VA、FL2VA 和 L2VA 基础生成模式。该指南解释了如何将提示词组织成按时序排列的镜头,并配合相机运动和音频(对白、音效、音乐),同时为每种模式提供了示例。MiniMax H3 首尾帧视频
通过 MiniMax H3 API 在首帧图像和可选末帧图像之间生成视频。输出的宽高比与输入图像保持一致。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 FLF2V”
首帧:angel-warrior-demon-battle-start.png
工作流的首帧图像,或使用您自己的图像。
末帧:angel-warrior-demon-battle-end.png
工作流的末帧图像,或使用您自己的图像。
提示技巧
- 帧:
first_frame输入为必填;last_frame为可选。模型会生成两者之间的运动 - 宽高比:输出跟随输入图像,因此请保持两帧的宽高比一致
- 图像约束:每帧的宽度和高度必须在 256 到 5760 像素之间,宽高比在 2:5 到 5:2 之间
- 提示词:描述两帧之间的过渡,以及您想要的音频(对白、音效、音乐)
提示词编写指南
MiniMax 为基础生成模式(T2VA、I2VA、FL2VA 和 L2VA)发布了官方的视频提示词编写指南。该指南解释了如何将提示词组织为带时间轴的镜头,包含相机运镜和音频(对白、音效、音乐),并为每种模式提供了示例。MiniMax H3 参考转视频
通过 MiniMax H3 API,以参考图像、视频和音频作为条件生成视频。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 R2V”
参考图像:9panel_storyboard_golden_hour_clay_court.png
该工作流的分镜参考图,也可以使用你自己的图像。
提示词技巧
- 按标签引用:在提示词中按顺序引用每个输入,例如
Image 1、Video 1或Audio 1。 - 限制:最多 9 张参考图像、3 个参考视频和 3 段参考音频。每个视频或音频片段必须为 2–15 秒;参考视频与参考音频的总时长上限均为 15 秒。
- 音频需要视觉锚点:如果没有至少一个参考图像或参考视频,就无法使用参考音频。
- 视频要求:参考视频的帧率必须为 23.976–60 FPS。
- 提示词:为每个参考内容分配一个任务(身份、风格、动作、声音),并描述目标镜头;明确的分配通常效果要好得多。