Skip to main content
MiniMax H3 是 MiniMax 推出的通用全模态生成模型,可通过 MiniMax H3 API 节点在 ComfyUI 中使用。API 工作流在 MiniMax 的服务器上运行生成任务,因此无需下载模型,也不需要本地 GPU,已生成视频的每一秒都会计入你的 Comfy API 账户。 MiniMax H3 可生成带有原生立体声音频的视频:人声、音效和音乐会在同一次前向传播中共同建模,而非事后叠加。输出最高支持 2K 分辨率,每个片段时长 5-15 秒。
这些 API 工作流会通过你的 Comfy 账户在 MiniMax 的服务器上运行。如需在自有硬件上本地运行 H3 进行商业用途,你需要获取 MiniMax 商业许可证,该许可证可通过唯一官方经销商 Comfy 购买。

MiniMax H3 擅长什么

  • 原生立体声音频:人声、音效和音乐与视频在单次前向传播中一起建模,而不是事后叠加
  • 高分辨率输出:每个片段时长为 5-15 秒,分辨率最高可达 2K
  • 文生视频:根据文本提示生成带音频的视频
  • 首尾帧视频:生成首帧与可选尾帧图像之间的运动
  • 参考条件生成:基于最多 9 张参考图像、3 个参考视频和 3 段参考音频生成视频

示例输出

通过单个提示词进行文生视频生成,并带有原生立体声音频: 首尾帧生成,由模型创建两个帧之间的运动:
使用 API 节点需要保证你已经正常登录,并在受许可的网络环境下使用,请参考API 节点总览部分文档来了解使用 API 节点的具体使用要求。
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

MiniMax H3 API 工作流

模板库随附以下三个 API 示例工作流:
  • 文生视频:根据文本提示词生成视频
  • 首尾帧视频:在首帧和末帧图像之间生成视频
  • 参考生成视频:根据参考图像、视频和音频生成视频

MiniMax H3 文生视频

通过 MiniMax H3 API 从文本提示词生成视频,并输出原生立体声音频。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 T2V”

提示词技巧

  1. 提示词:在一个文本块中描述整个场景以及伴随的音频(对白、音效、音乐)
  2. 时长:时长输入支持 5-15 秒;该工作流自带一个快速的 5 秒预览
  3. 分辨率和比例:API 以 2K 分辨率渲染;选择宽高比预设,例如 16:99:161:1
  4. 水印:AIGC 水印默认关闭;如有需要,可在节点的高级设置中启用

提示词编写指南

MiniMax 发布了一份官方的视频提示词编写指南,适用于 T2VA、I2VA、FL2VA 和 L2VA 基础生成模式。该指南解释了如何将提示词组织成按时序排列的镜头,并配合相机运动和音频(对白、音效、音乐),同时为每种模式提供了示例。

MiniMax H3 首尾帧视频

通过 MiniMax H3 API 在首帧图像和可选末帧图像之间生成视频。输出的宽高比与输入图像保持一致。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 FLF2V”

首帧:angel-warrior-demon-battle-start.png

工作流的首帧图像,或使用您自己的图像。

末帧:angel-warrior-demon-battle-end.png

工作流的末帧图像,或使用您自己的图像。

提示技巧

  1. first_frame 输入为必填;last_frame 为可选。模型会生成两者之间的运动
  2. 宽高比:输出跟随输入图像,因此请保持两帧的宽高比一致
  3. 图像约束:每帧的宽度和高度必须在 256 到 5760 像素之间,宽高比在 2:5 到 5:2 之间
  4. 提示词:描述两帧之间的过渡,以及您想要的音频(对白、音效、音乐)

提示词编写指南

MiniMax 为基础生成模式(T2VA、I2VA、FL2VA 和 L2VA)发布了官方的视频提示词编写指南。该指南解释了如何将提示词组织为带时间轴的镜头,包含相机运镜和音频(对白、音效、音乐),并为每种模式提供了示例。

MiniMax H3 参考转视频

通过 MiniMax H3 API,以参考图像、视频和音频作为条件生成视频。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 R2V”

参考图像:9panel_storyboard_golden_hour_clay_court.png

该工作流的分镜参考图,也可以使用你自己的图像。

提示词技巧

  1. 按标签引用:在提示词中按顺序引用每个输入,例如 Image 1Video 1Audio 1
  2. 限制:最多 9 张参考图像、3 个参考视频和 3 段参考音频。每个视频或音频片段必须为 2–15 秒;参考视频与参考音频的总时长上限均为 15 秒。
  3. 音频需要视觉锚点:如果没有至少一个参考图像或参考视频,就无法使用参考音频。
  4. 视频要求:参考视频的帧率必须为 23.976–60 FPS。
  5. 提示词:为每个参考内容分配一个任务(身份、风格、动作、声音),并描述目标镜头;明确的分配通常效果要好得多。

提示词编写指南

MiniMax 为参考驱动生成(R2V)发布了一份官方的 全参考模式提示词编写指南。该指南涵盖改写输出的结构,包括主体定义、参考标签和保留度分析,以及如何为每个参考内容在目标镜头中分配角色。