前言
今年7月31日,MiniMax发布了其视频生成模型MiniMax H3。次月,其又发布了音乐生成模型 MiniMax Music 3。这两个模型都是开源模型,我都部署到了本地进行体验。先来看看生成出来的成品:
个人感觉效果不错,写一篇博客记录一下折腾MiniMax H3的过程。至于MiniMax Music 3,其实和下文的部署流程类似,就不单独拿出来写了。下文并不详细,仅供参考,若想了解更多,可以在bilibili等平台中搜索相关内容。
模型部署
先说一下我使用的设备配置:5060Ti 16g,32g ddr4 4000hz内存,16g虚拟内存。我实测下来能正常跑,再搭配上lora、SageAttention等加速方案还是能快乐玩耍的。
安装ComfyUI
ComfyUI 是一个基于节点图的可视化 AI 工作流引擎,将文生图、图生图、视频生成等扩散模型推理过程拆解为"加载模型→编码提示词→采样去噪→解码输出"等独立节点,通过连线构建有向图来精确控制每一步的参数与数据流。它支持 Stable Diffusion 全系列、Flux、Wan 等主流模型,兼容 ControlNet、LoRA、IPAdapter 等扩展,具备节点级缓存、显存动态调度、工作流 JSON 导出与图片内嵌复现等工程能力。本质上,ComfyUI 不生产模型,而是充当推理编排器,让用户从"调滑块"升级为"搭流水线",实现复杂生成任务的精细化控制与可复现生产。
关于启动器,我使用的是官方提供的Comfy Desktop。除此以外还有其它大佬打包的启动器,如秋叶启动器、绘世启动器,感兴趣的可以自行下载体验。

下载官方安装包后按照提示进行按照即可,它会自动帮你补齐运行所需的python等环境。推荐安装的时候开启网络代理,否则可能会下载失败。
下载模型
安装完成后,先去下载所需的模型。打开魔搭社区 (若网络支持,推荐使用Hugging Face),搜索并找到Comfy-Org/MiniMax-H3,这是适用于 ComfyUI 的重新打包模型文件。对于H3视频模型,我们需要的下载一个diffusion_models模型,一个text_encoders模型,一个lora模型,2个vae模型。
下载之前先解释一下这些文件名后缀的意思:fp32、fp16、int8等代表的是精度,pruned(剪枝)代表删掉一部分模型参数,convrot(卷积旋转量化)是一种模型量化技术。
| 精度 | 大小对比 | 质量 | 适合什么 |
|---|---|---|---|
| fp32 | 最大 | 最好 | 训练微调,本地别下 |
| fp16 | 大 | 一般,容易出 bug | 不用选 |
| bf16 | 大 | 最好,日常基准 | 显存够就选这个 |
| fp8 | 一半大小 | 很好 | 40/50 系显卡用 |
| int8 | 一半大小 | 不错,轻微掉质 | 绝大多数显卡通用 |
| nvfp4 | 很小 | 一般 | 仅 RTX50 系列可用 |
我使用的是50系显卡,且配置并不高,故我选择下载以下模型:
- minimax_h3_fl2va_pruned_int8_convrot.safetensors
- qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
- minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors
- minimax_h3_audio_vae_fp32.safetensors
- minimax_h3_audio_vae_fp16.safetensors
如果你的配置很高,可以选择更高精度的模型;如果配置很低,可以尝试使用GGUF格式的模型。
下载后,打开你的ComfyUI文件目录,我安装在D盘,故打开D:\Comfy-Desktop。之后将下载下来的模型文件按照以下位置放置
📂 ComfyUI-Shared/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ ├── 📂 loras/
│ │ ├── minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16. safetensors
│ ├── 📂 vae/
│ │ ├── minimax_h3_audio_vae_fp32.safetensors
│ │ └── minimax_h3_video_vae_fp16.safetensors
把玩官方工作流
刚开始玩可以使用模板中提供的官方工作流,我这里以文生视频演示。打开工作流后,有可能会提示缺少模型,这是因为预设模型和你下载使用的模型不一致,只需要改成你下载的模型即可。
若使用4步lora进行加速,需要在image to video节点中开启turbo_mode,并将turbo_steps更改为4。如下图所示。image to video节点中的duration参数是设置视频时长的,其取值范围为 4–15 seconds。
noise_seed(噪声种子)是干啥的呢?它的作用是控制扩散模型去噪过程的起始随机噪声图案。
这是啥意思??? 我个人理解是如果其它参数保持不变,只改动noise_seed,那么生成出来的视频是有差异的,类似于《我的世界》中的地图种子。
接着来看分辨率选择器这个节点,百万像素参数的配置可以参考下方的参考图,数值越大像素越大,画质越高。同时所需要的内存也更大。
设置完成后,关闭无用的应用(腾出内存),点击运行按钮,等待即可。


更进一步
除了使用官方工作流外,还可以使用社区制作的优化工作流。例如下图中的是由黎黎原上咩制作的带有SolAttn_triton等优化插件的工作流。
在第一次使用社区工作流时,大概率会遇到节点缺失的问题,很好解决。比如我缺少了SolAttn_triton节点,那么我只需要打开ComfyUI配置目录下的自定义节点文件夹(例如 D:\Comfy-Desktop\ComfyUI-Installs\ComfyUI\ComfyUI\custom_nodes)打开终端,使用git拉取该插件仓库 git clone https://github.com/kijai/ComfyUI-SolAttn_triton,之后重启ComfyUI即可解决。
现在ai这么方便,遇到搞不明白的问题,可以发给ai解决。

再说说LoRA吧,LoRA 有两种常见用途:
- 定制角色/风格/动作的"内容 LoRA"
- 专门用来少步采样的"Turbo LoRA"
使用Turbo LoRA可以加快视频生成,但同时也会因为减少采样步数而导致视频质量下降。我使用的Turbo LoRA是lightx2v发布的8步LoRA(https://huggingface.co/lightx2v/Minimax-h3-Turbo ),听说是目前效果最好的。
视频产出后,如果觉得画质不清晰,除了提高百万像素参数以外,还可以选择用其它模型对视频进行放大,如我使用的FlashVSR。 在ComfyUI里使用该模型,可以使用ComfyUI_FlashVSR插件。但是我的环境安装不上其必备的Block-Sparse-Attention,所以我选择ComfyUI-FlashVSR_Ultra_Fast,它用 Sparse_SageAttention 替换了 Block-Sparse-Attention,无需编译任何自定义内核。配置很简单,先下载对应的模型,之后连一下节点即可使用,如下图。

以下是放大后的视频,可以与上文的第一个视频进行对比,效果还是很明显的:
结尾
这是我第一次自己在本地跑模型,折腾了一周时间,挺好玩的,也学会了很多东西。在这之前,我也想过尝试seedance等闭源模型,奈何价格太高。MiniMax H3和Music 3开源后,零成本(电费?)在本地跑!你知道的,我一直是MiniMax的忠实用户……我将称MiniMax为多模态领域的源神!


评论区
评论加载中...