Turbo + 低显存:把 20 步降到 4–8 步 — MiniMax H3 教程
在已经跑通的 H3 ComfyUI 基线上安装社区 Turbo 节点,用 6–8 步获得可用成片,并在爆显存时有明确降级顺序。
适用人群: 已经能用官方 H3 工作流出片,但生成太慢或显存紧张的 NVIDIA 用户。
硬件要求: NVIDIA GPU;先记录原生工作流的峰值显存与耗时。低显存模式是兜底,不是默认画质选项。
前置条件
- 第一条教程的原生 T2V 或 I2V 工作流已经稳定输出
- 固定 seed、Prompt、分辨率、时长和输入素材,便于 A/B 对比
- ComfyUI-Manager 可用,或能手动安装 custom_nodes
- 从 Larryvrh 的 Hugging Face 仓库下载 minimax_h3_turbo_v4_step600_ema.safetensors
执行步骤
- 先用原生 20 步工作流跑一次,记录总耗时、峰值显存、画面细节、快速运动和声音质量;这份结果是唯一基线。
- 在 ComfyUI-Manager 搜索 MiniMax-H3 Turbo 并安装;或在 ComfyUI/custom_nodes/ 克隆仓库。完成后彻底重启 ComfyUI,确认控制台没有导入错误。
- 把 minimax_h3_turbo_v4_step600_ema.safetensors 放入 ComfyUI/models/loras/。多数场景优先 v4-600;只有 4 步且高速大幅运动出现拖影时,才对比旧 v1-850。
- 从官方 T2V/I2V 图开始,在 Load Diffusion Model 与 SamplerCustomAdvanced 之间插入 MiniMax-H3 Turbo LoRA 节点,并选择刚放入的权重。
- 用 MiniMax-H3 Turbo Sampler 给 SamplerCustomAdvanced 提供 SAMPLER;BasicScheduler 设为 simple。其他 conditioning、双 VAE 解码和音频输出保持基线不变。
- 第一轮设 8 步、strength=1.0;成功后再试 6 步。4 步只用于快速构图预览或明确的低预算场景,不要默认把 4 步结果当最终质量。
- 用完全相同的 seed、Prompt、素材、分辨率和时长重新生成,比较耗时、脸手细节、快速运动拖影、音质与同步。一次只改 Turbo 这一个变量。
- 如果爆显存,先降低预览分辨率或时长,再关闭非必要预览/节点,最后才打开 low_vram。low_vram 会降低峰值显存,但量化输出可能更软。
- 如果画面拖影或模糊,可在明确问题片段把 strength 小幅提高到约 1.05–1.2;如果过锐和颗粒明显,降到约 0.8–0.95。每次只改一个参数。
- 保留原生与 Turbo 两份工作流。Turbo 用于选镜与批量预览,重要镜头仍与 20 步原生基线对比后再决定成片版本。
命令
cd ComfyUI/custom_nodes
git clone https://github.com/larryvrh/ComfyUI-MiniMax-H3-Turbo
git -C ComfyUI-MiniMax-H3-Turbo pull
ComfyUI/models/loras/minimax_h3_turbo_v4_step600_ema.safetensors
注意事项
- 4–8 步是有效范围,6–8 步通常明显优于 4 步;超过 8 步不再带来稳定收益,还可能过锐。
- strength 默认保持 1.0;只有具体片段出现拖影或过锐时才小幅调整。
- low_vram 会以清晰度换显存,不要在显存足够时默认开启。
- Turbo 的音质和高速运动仍在改进;不要把采样步数缩短直接宣传成等比例端到端加速。
- 不要把 Turbo、Spectrum、EasyCache 等全部叠加;优化器的误差与音频损失可能累积。
查看原始来源 · Larryvrh · 2026-08-23