4-bit + DiffSynth:最低 8GB 显存路线 — MiniMax H3 教程
通过 4-bit 量化与显存自适应推理在更小显存上运行 H3。
原文: ModelScope @ModelScope2022
ModelScope @ModelScope2022 · 出处
Run your MiniMax-H3 locally, even on Mac!
With the 4-bit-quantized version coupled with DiffSynth-Studio, you can run MiniMax-H3 with a minimum of 8GB vRAM 🚀🚀🚀
🤖 https://modelscope.ai/models/DiffSynth-Studio/MiniMax-H3-NF4
More to explore:
• Inference that adapt to your available vRAM: takes as little as 8GB
• Runs in extreme mode on a 16GB Apple M-series Mac
• LoRA training with a 24GB consumer GPU
All while preserving the powerful capability of MiniMax-H3! Let’s cook 🔥
适用人群: 8GB 显存或希望在 Mac 上尝试量化 H3 的用户。
硬件要求: 最低 8GB VRAM 为来源公布下限;实际速度和可用模式需复核。
前置条件
- DiffSynth-Studio
- 匹配的 4-bit H3 权重
- 足够系统内存与磁盘
执行步骤
- 新建独立 Python 环境,从源码安装 DiffSynth-Studio;先查看 H3 文档当前是否仍标注 NF4 最低约 7GB VRAM。
- 打开 model_inference_low_vram/MiniMax-H3-NF4-FL2VA.py,保留四个 NF4 模型文件的匹配 origin_file_pattern。
- 让 vram_limit 使用可用显存减 2GB 的文档默认策略;不要伪装或硬编码比物理显存更大的数值。
- 第一轮使用 480×832、124 帧或示例更小设置,固定 seed,等待模型按需在 CPU/GPU 间调度。
- 用 ffprobe 检查输出 t2va.mp4 的视频、24fps、32kHz 立体声音频轨,并人工试听同步。
- 低显存基线通过后再分别尝试 Ref2VA、画布或帧数;记录每次总耗时和系统内存,避免只报告 GPU 显存。
命令
git clone https://github.com/modelscope/DiffSynth-Studio.git
cd DiffSynth-Studio && pip install -e .
python examples/minimax_h3/model_inference_low_vram/MiniMax-H3-NF4-FL2VA.py
ffprobe -v error -show_streams t2va.mp4
注意事项
- 低显存可运行不等于速度快;量化质量与原生模型不同。
查看原始来源 · ModelScope · 2026-08-23
导读 · 来源核对: 2026-08-23 · 本站实测: 未进行生成实测
先阅读适用条件,再到原作者内容中查看完整演示与更新。
原作者资料见下方来源;未提供的素材或参数不由本站补写。
适用版本
DiffSynth-Studio main @ 2026-08-23 · MiniMax-H3-NF4 low-VRAM example
故障排查
下载或载入 NF4 组件失败
逐一核对四个 origin_file_pattern 与模型 ID;FL2VA 和 Ref2VA 组件不能混用。
显存够但系统卡死
量化低显存依赖 CPU offload;检查系统内存和交换空间,减小画布或帧数后重试。