ESC
开源 2 分钟阅读

ComfyUI-MiniMax-H3-Turbo:4步采样运行MiniMax-H3视频与同步音频生成

ComfyUI-MiniMax-H3-Turbo 是一个新节点,通过 Turbo LoRA 将 MiniMax-H3 的“视频+同步音频”联合生成从约20步降至4步。两个节点可直接替换官方工作流中的采样部分,支持文生视频和图生视频,兼容所有基础模型(包括剪枝版),并解决了4步时音频失真的问题。当前 LoRA 仍为预览版,需注意锐化伪影。

来源:GitHub

ComfyUI-MiniMax-H3-Turbo

运行 MiniMax-H3 — 联合 视频 + 同步音频 — 仅需 4 个采样步骤(原约 20 步), 配合 MiniMax-H3 Turbo LoRA。

两个节点可直接插入官方 H3 工作流(文生视频和图生视频):

节点功能
MiniMax-H3 Turbo LoRAMODEL → MODEL,应用 turbo LoRA
MiniMax-H3 Turbo Sampler (4-step)→ SAMPLER,供 SamplerCustomAdvanced 使用

⚠️ 预览版。 当前 LoRA(ckpt850)是本轮训练的最终检查点 — 在 4 步下图像锐利,但存在已知伪影(塑料感皮肤、过度锐化的颗粒);训练已暂停,我们正在修复这些问题。 详见 LoRA 仓库。

安装

🔄 保持节点更新。 它正在积极演进,新功能会随新版本发布(例如首次发布后增加了剪枝基础模型支持)。可通过 ComfyUI-Manager 更新,或手动安装时用 git pull。

通过 ComfyUI-Manager — 搜索“MiniMax-H3 Turbo”并安装。

或手动安装:

cd ComfyUI/custom_nodes
git clone https://github.com/larryvrh/ComfyUI-MiniMax-H3-Turbo

然后重启 ComfyUI。

下载 LoRA 从 larryvrh/MiniMax-H3-Turbo-Lora 并将 .safetensors 放入 ComfyUI/models/loras/。

你还需要官方发布的基础 MiniMax-H3 模型、VAE 和文本编码器 — 参见 MiniMax-H3 教程。

使用

从 官方 MiniMax-H3 工作流(t2v 或 i2v)开始,做两处修改:

  1. 在模型加载器和采样器之间插入 MiniMax-H3 Turbo LoRA (... → Load Diffusion Model → MiniMax-H3 Turbo LoRA → SamplerCustomAdvanced), 并选择 turbo .safetensors。
  2. 将供给 SamplerCustomAdvanced 的采样器替换为 MiniMax-H3 Turbo Sampler (4-step), 并将调度器节点设为 4 步 (BasicScheduler,调度器 simple)。

其余部分 — 条件节点、VAE 解码、音频输出 — 保持官方工作流不变,因此 文生视频和图生视频 都能原样工作。现成的 t2v 工作流位于 example_workflows/ — 将其拖入 ComfyUI 即可查看连接方式。

基础模型:适用于任何 MiniMax-H3 基础模型 — 完整版(bf16、int8_convrot) 以及剪枝/曲线变体(pruned_int8、pruned_fp8)。节点会自动检测剪枝基础模型,并在运行时重新注入 LoRA 的时间条件(节点附带一个小的 silu(t_emb) 网格用于此目的),因此一个 LoRA 文件覆盖所有基础模型。

为什么需要自定义采样器

MiniMax-H3 在两条不同的流程调度上对视频和音频流进行去噪(视频 shift 12,音频 shift 3)。ComfyUI 自带的采样器在一条调度上对两条流同时步进,在约 20 步时没问题,但在 4 步时会严重过冲音频 — 导致音频失真或炸裂。该采样器让每条流在自己的调度上步进,因此音频在 4 步时保持干净。如果你加载了 LoRA 并使用自带采样器在 4 步时音频损坏,原因就在这里。

注意事项

  • 步数:使用 ckpt850 时,4 步已经足够锐利(早期检查点需要 6–8 步)。任何 ≥ 4 的步数都有效;更多步数仍有一点帮助。调度器保持 simple。

  • LoRA 强度(节点输入,默认 1.0)是锐度/伪影权衡的旋钮:如果结果显示 模糊重影/拖影,将强度 调高(例如 1.05–1.2);如果显示 过度锐化颗粒/伪影,则 调低(例如 0.8–0.95)。

  • 分辨率 / 长度:宽和高是 32 的倍数(短边通常为 768);帧数基于 24 fps,并对齐到模型的 17·k+5 网格(124 ≈ 5 秒)。验证范围约 124–362 帧。

  • VRAM / low_vram:MiniMax-H3 很大(约 33 B)。LoRA 节点有一个 low_vram 开关,可在锐度和峰值 VRAM 之间取舍:

    • 关闭(默认) — 在运行时应用 LoRA(绕过):最锐利,推荐路径,但会额外消耗一些峰值 VRAM。
    • 开启 — 将 LoRA 合并到权重中:峰值 VRAM 最低,因此较小的 GPU 也能运行,更长/更高分辨率的片段也能适应,但结果在量化(int8 / fp8 / 剪枝)基础模型上 更柔和,因为微小的更新在折叠回量化权重时会被部分舍入掉。

    如果遇到内存不足错误,请将 low_vram 设为 开启(和/或降低分辨率或帧数)。节点会流式加载基础模型,因此它也能在远比 33 B 尺寸所暗示的 GPU 上运行 — 只有最大分辨率才需要在 bypass 模式下使用 80 GB GPU。

许可证

Apache-2.0。