ComfyUI + MiniMax-H3 部署与使用说明
本文由Codex生成
随着 MiniMax-H3 开放模型权重,个人用户也可以通过 ComfyUI 将这款全模态生成模型部署到本地显卡上。部署完成后,文生视频、图生视频、首尾帧控制、参考素材生成以及原生音视频联合生成,都可以在自己的服务器上完成。
MiniMax-H3 是什么?
MiniMax-H3 是一款面向内容创作的通用全模态生成模型。它能够统一理解由文本、图像、视频和声音共同组成的多模态上下文,并根据自然语言描述完成视频生成、参考和编辑。
传统视频模型通常把文生视频、图生视频、动作参考、角色参考、首尾帧控制、音色参考和视频编辑拆分成不同模型或不同功能。H3 的设计方向则是统一这些任务,让用户通过自然语言说明不同素材之间的关系。模型会尝试同时理解视频的镜头运动、图片中的人物形象、音频中的声音特征以及文本中的创作要求,而不只是简单地把几个独立模型串联起来。
根据 MiniMax 官方介绍,H3 最高支持生成 15 秒、2K 分辨率的内容,并且可以直接输出带有原生双声道声音的音视频。声音不是在视频完成后额外配上去的,而是作为生成过程的一部分,与画面联合建模,因此可用于对白、环境声、动作音效和音乐等内容。
通过 ComfyUI 可以做什么?
ComfyUI 是一套基于节点和工作流的生成式 AI 图形界面。模型加载、提示词编码、视频采样、画面解码、音频解码和文件输出,都可以通过可视化节点连接起来。
本地部署 MiniMax-H3 后,可以逐步实现以下工作流:
- 文生视频:根据文字描述生成完整的视频镜头。
- 图生视频:让静态人物、产品图或场景图动起来。
- 首帧控制:从指定画面开始生成后续内容。
- 首尾帧控制:指定视频起点和终点,由模型生成中间过程。
- 参考生成:参考人物、风格、运镜、动作、视频或音频生成新内容。
- 视频编辑:通过自然语言描述需要保留和修改的内容。
- 原生音视频生成:同时生成画面、对白、环境声和动作音效。
- 多镜头内容:在一段视频中表达镜头切换和连续叙事。
这意味着它不仅可以制作几秒钟的演示动画,还可以用于 AI 短剧、动态海报、影视分镜、产品广告、人物表演、音乐视频、游戏内容和电商素材。
本次部署方案
本次使用的主要硬件和软件环境为:
系统:Ubuntu Desktop 24.04
显卡:NVIDIA GeForce RTX 5090 D
显存:32GB
系统内存:约 128GB
推理框架:PyTorch + CUDA
操作界面:ComfyUI
模型:MiniMax-H3
考虑到完整 BF16 主模型约 66GB,单张 32GB 显卡无法完整容纳,因此采用更适合本机配置的量化组合:
H3 主模型:Pruned INT8 ConvRot
文本编码器:Qwen3-VL 32B NVFP4 AWQ
视频 VAE:FP16
音频 VAE:FP32
这套方案降低了显存和系统内存压力,同时保留 MiniMax-H3 的主要生成能力。ComfyUI 会在不同阶段加载文本编码器、视频主模型和 VAE,并在显存与系统内存之间进行调度。
适合 AI 短剧生产吗?
MiniMax-H3 能明显扩展 AI 短剧的制作空间,但目前更适合采用“分镜生成”的方式,而不是一次生成一整集。
一种实用流程是:
- 编写故事梗概、人物设定和场景设定。
- 将一集内容拆分成多个 5~15 秒的镜头。
- 为主要角色准备统一的参考图片、声音和提示词。
- 使用图生视频或参考生成完成单个镜头。
- 分别生成对白、环境声和动作画面。
- 选择效果较好的镜头进行放大、插帧和剪辑。
- 最后通过剪辑软件组合成完整短剧。
本地运行后,每个镜头都可以反复尝试,不必担心消耗在线平台积分。但角色跨镜头一致性、长时间连续叙事、复杂动作和稳定文字等问题,仍需要通过参考素材、固定提示词、工作流设计和后期剪辑来解决。
总结
ComfyUI + MiniMax-H3 提供了一条值得尝试的本地 AI 视频生产路线:ComfyUI 负责可视化编排和模型调度,MiniMax-H3 负责统一理解文本、图片、视频和声音,并生成带原生双声道声音的视频内容。
它不能完全取代导演、剪辑和后期制作,也不能保证每次生成都能直接使用,但本地模型让创作者摆脱了在线平台次数和 API 余额的限制,可以围绕同一个角色、镜头或短剧项目持续试验。
对于拥有高性能 NVIDIA 显卡的用户而言,这不仅是一个文生视频工具,也可以逐渐扩展成一套由自己掌控的全模态内容创作工作站。
1. 当前服务器配置
系统:Ubuntu Desktop 24.04
GPU:NVIDIA GeForce RTX 5090 D
显存:32GB
系统内存:约 128GB
NVIDIA 驱动:595.84
Python:3.12
PyTorch:2.13.0 + CUDA 13.0
ComfyUI 目录:/data/ComfyUI
虚拟环境:/data/ComfyUI/.venv
Web 端口:8188
安装与运行 ComfyUI 使用普通用户权限,不要使用 root 用户运行。
PyTorch 安装包已经包含所需 CUDA Runtime。仅为运行 ComfyUI,无需单独安装完整 CUDA Toolkit。
2. 安装系统依赖
sudo apt update
sudo apt install -y \
git \
git-lfs \
ffmpeg \
python3.12-venv \
wget \
tmux
git lfs install
3. 设置网络代理(可选)
如果 GitHub、Hugging Face 或 PyTorch 下载失败,并且 v2rayN 的 HTTP 代理端口为 10808,在当前终端执行:
export http_proxy=http://127.0.0.1:10808
export https_proxy=http://127.0.0.1:10808
export HTTP_PROXY=http://127.0.0.1:10808
export HTTPS_PROXY=http://127.0.0.1:10808
export NO_PROXY=localhost,127.0.0.1
检查代理端口:
ss -lntp | grep 10808
这些代理变量只对当前终端有效。打开新的 SSH 终端后,需要重新设置。
4. 安装 ComfyUI
4.1 创建目录
sudo mkdir -p /data/ComfyUI
sudo chown dabai:dabai /data/ComfyUI
4.2 下载 ComfyUI
git -c http.version=HTTP/1.1 clone --depth=1 \
https://github.com/Comfy-Org/ComfyUI.git \
/data/ComfyUI
如果 /data/ComfyUI 已经包含完整仓库,不要重复克隆。
检查仓库:
cd /data/ComfyUI
git status
git log -1 --oneline
test -f main.py && echo "ComfyUI 仓库完整"
5. 创建独立虚拟环境
进入 ComfyUI 目录:
cd /data/ComfyUI
创建 Python 3.12 虚拟环境:
python3.12 -m venv .venv
进入虚拟环境:
source /data/ComfyUI/.venv/bin/activate
进入成功后,终端提示符前面会出现 (.venv),例如:
(.venv) dabai@dabai-AI:/data/ComfyUI$
升级 Python 安装工具:
python -m pip install --upgrade pip setuptools wheel
5.1 退出虚拟环境
deactivate
退出后,终端前面的 (.venv) 会消失。
5.2 再次进入虚拟环境
cd /data/ComfyUI
source .venv/bin/activate
关闭终端、断开 SSH 或退出虚拟环境,都不会删除 .venv。
6. 安装 PyTorch 和 ComfyUI 依赖
先进入虚拟环境:
cd /data/ComfyUI
source .venv/bin/activate
安装 CUDA 13.0 版 PyTorch:
python -m pip install \
torch \
torchvision \
torchaudio \
--index-url https://download.pytorch.org/whl/cu130
安装 ComfyUI 依赖:
python -m pip install -r requirements.txt
安装内置 Manager 所需依赖:
python -m pip install -r manager_requirements.txt
6.1 验证 PyTorch 和显卡
python -c "import torch; print('PyTorch:', torch.__version__); print('CUDA:', torch.version.cuda); print('CUDA 可用:', torch.cuda.is_available()); print('GPU:', torch.cuda.get_device_name(0))"
当前服务器正常输出应类似:
PyTorch: 2.13.0+cu130
CUDA: 13.0
CUDA 可用: True
GPU: NVIDIA GeForce RTX 5090 D
检查 NVIDIA 驱动:
nvidia-smi
7. MiniMax-H3 模型选择说明
7.1 为什么选择这四个模型
当前服务器是 RTX 5090 D,拥有 32GB 显存和约 128GB 系统内存。
MiniMax-H3 完整 BF16 主模型约 66GB,无法完整放入 32GB 显存。首次部署选择官方工作流使用的低显存组合:
主模型:Pruned INT8 ConvRot
文本编码器:Qwen3-VL 32B NVFP4 AWQ
视频 VAE:FP16
音频 VAE:FP32
这套组合具有以下特点:
- 适合 RTX 5090 D 的 32GB 显存。
- 主模型约 21GB,比完整 BF16 版更容易运行。
- NVFP4 文本编码器适合 RTX 50 系列 Blackwell 显卡。
- 支持文本生成视频和图片生成视频。
- 支持视频与同步音频生成。
- 由最新版 ComfyUI 原生支持。
- 不需要安装第三方模型加载节点。
- ComfyUI 会按阶段在显存和系统内存之间调度模型。
pruned 版本通过移除推理时不需要的权重降低文件大小。与完整 BF16 模型相比,复杂运动、物理效果及微小背景细节可能略有损失,但更适合单张 32GB 显卡。
8. 四个模型的用途
8.1 MiniMax-H3 视频生成主模型
文件:
minimax_h3_fl2va_pruned_int8_convrot.safetensors
目录:
/data/ComfyUI/models/diffusion_models/
预计大小约 21GB。
用途:
- MiniMax-H3 的核心视频生成模型。
- 根据提示词和输入图片生成视频潜空间数据。
- 生成供视频 VAE 和音频 VAE 解码的数据。
- 用于官方文本生成视频和图片生成视频工作流。
文件名含义:
fl2va:用于帧、文本等条件到视频与音频的生成任务。pruned:移除了推理时不需要的权重。int8:使用 8 位量化,降低显存和内存占用。convrot:使用 ComfyUI 支持的低精度旋转量化格式。
选择原因:
- 完整 BF16 主模型约 66GB,不适合 32GB 显存。
- 完整 INT8 版本仍然较大。
- Pruned INT8 版本约 21GB,更适合 RTX 5090 D。
- 在画质、显存占用和运行稳定性之间比较均衡。
8.2 Qwen3-VL 文本与图像编码器
文件:
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
目录:
/data/ComfyUI/models/text_encoders/
预计大小约 16GB。
用途:
- 理解文本提示词。
- 理解输入图片和视觉条件。
- 把文本及图片转换成 H3 主模型能够使用的特征。
- 理解人物、场景、动作、镜头、声音和对白等指令。
文件名含义:
qwen3vl_32b:采用 32B 规模的 Qwen3-VL 多模态编码器。minimax_h3:已经适配 MiniMax-H3。nvfp4:采用 NVIDIA 4 位浮点格式。awq:采用 AWQ 量化方式降低资源占用。
选择原因:
- 完整精度的 32B 编码器资源占用很大。
- NVFP4 大幅降低显存和系统内存压力。
- RTX 5090 D 属于 Blackwell 架构,适合 NVFP4。
- 官方 MiniMax-H3 模板使用该版本。
- 文本编码完成后,ComfyUI 可以卸载编码器并加载视频主模型。
8.3 MiniMax-H3 视频 VAE
文件:
minimax_h3_video_vae_fp16.safetensors
目录:
/data/ComfyUI/models/vae/
用途:
- 将主模型生成的视频潜空间数据解码为实际视频画面。
- 在图生视频任务中编码输入图片。
- 影响最终视频的颜色、亮度和画面细节。
选择 FP16 的原因:
- 比 FP32 节省约一半内存。
- 比过度量化的 VAE 更不容易出现色块或解码异常。
- RTX 5090 D 对 FP16 有良好支持。
- 是画质、速度和显存占用之间的稳定选择。
8.4 MiniMax-H3 音频 VAE
文件:
minimax_h3_audio_vae_fp32.safetensors
目录:
/data/ComfyUI/models/vae/
用途:
- 将音频潜空间数据解码成真实声音。
- 生成与视频同步的对白、环境声和动作声。
- 由工作流将视频和音频合成为带声音的视频。
选择 FP32 的原因:
- 音频解码对数值误差比较敏感。
- 低精度可能产生杂音、爆音、失真或静音。
- 音频 VAE 本身相对较小,使用 FP32 不会造成太大的资源压力。
- 官方工作流指定使用该版本。
9. 四个模型之间的关系
四个文件不是四个任选其一的模型,而是一套完整的生成组件:
文本提示词/输入图片
│
▼
Qwen3-VL 文本与图像编码器
│
▼
MiniMax-H3 视频生成主模型
│
├── 视频潜空间 ──► 视频 VAE ──► 视频画面
│
└── 音频潜空间 ──► 音频 VAE ──► 同步声音
| 缺少的文件 | 影响 |
|---|---|
| H3 主模型 | 无法生成视频 |
| Qwen3-VL 编码器 | 无法正确理解提示词和输入图片 |
| 视频 VAE | 无法解码视频画面 |
| 音频 VAE | 无法生成或解码同步音频 |
如果只需要无声视频,可以修改工作流跳过音频部分。但官方默认工作流会使用音频 VAE,因此建议四个文件全部下载。
10. 当前模型支持范围
当前下载的是 fl2va 主模型,主要用于:
- Text to Video:文本生成视频
- Image to Video:图片生成视频
- First Frame:首帧控制
- First and Last Frame:首尾帧控制
- 原生同步音频生成
复杂的 Reference to Video、多参考素材或视频动作参考工作流,可能还需要:
minimax_h3_ref2va_pruned_int8_convrot.safetensors
ref2va 不包含在当前基础四文件中。建议先运行稳定 fl2va 工作流,再按需求增加参考模型。
11. 下载 MiniMax-H3 模型
11.1 安装 Hugging Face 工具
进入虚拟环境:
cd /data/ComfyUI
source .venv/bin/activate
安装下载工具:
python -m pip install -U huggingface_hub
验证:
hf --help
11.2 创建模型目录
cd /data/ComfyUI
mkdir -p models/diffusion_models
mkdir -p models/text_encoders
mkdir -p models/vae
11.3 下载四个模型
如果需要代理,先设置代理变量,然后执行:
hf download Comfy-Org/MiniMax-H3 \
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
vae/minimax_h3_video_vae_fp16.safetensors \
vae/minimax_h3_audio_vae_fp32.safetensors \
--local-dir /data/ComfyUI/models
下载约数十 GB,可能需要较长时间。下载中断后,重新执行相同命令即可,工具会复用已经完成的文件并继续下载。
查看下载占用:
watch -n 5 'du -sh /data/ComfyUI/models; df -h /'
按 Ctrl+C 退出观察。
11.4 下载完成后的目录
/data/ComfyUI/models/
├── diffusion_models/
│ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
├── text_encoders/
│ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└── vae/
├── minimax_h3_video_vae_fp16.safetensors
└── minimax_h3_audio_vae_fp32.safetensors
11.5 检查模型文件
ls -lh \
/data/ComfyUI/models/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
/data/ComfyUI/models/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
/data/ComfyUI/models/vae/minimax_h3_video_vae_fp16.safetensors \
/data/ComfyUI/models/vae/minimax_h3_audio_vae_fp32.safetensors
检查模型总大小:
du -sh /data/ComfyUI/models
12. 前台启动 ComfyUI
如果 Ollama 正在占用显存,可以先停止:
sudo systemctl stop ollama
进入虚拟环境:
cd /data/ComfyUI
source .venv/bin/activate
启动:
python main.py \
--listen 0.0.0.0 \
--port 8188 \
--enable-manager
看到以下提示表示启动成功:
Starting server
To see the GUI go to: http://0.0.0.0:8188
查看服务器 IP:
hostname -I
在其他电脑浏览器访问:
http://服务器IP:8188
例如:
http://192.168.1.XX:8188
13. 停止和退出 ComfyUI
如果 ComfyUI 正在当前终端前台运行,按:
Ctrl+C
停止后退出虚拟环境:
deactivate
退出 SSH:
exit
14. 使用 tmux 后台运行
使用 tmux 后,即使断开 SSH,ComfyUI 也会继续运行。
14.1 创建 tmux 会话
tmux new -s comfyui
14.2 在 tmux 中启动 ComfyUI
cd /data/ComfyUI
source .venv/bin/activate
python main.py \
--listen 0.0.0.0 \
--port 8188 \
--enable-manager
14.3 离开 tmux 但保持运行
依次按下:
Ctrl+B
D
14.4 重新进入 ComfyUI 会话
tmux attach -t comfyui
14.5 查看所有 tmux 会话
tmux ls
14.6 停止后台 ComfyUI
进入 tmux:
tmux attach -t comfyui
按 Ctrl+C 停止 ComfyUI,然后执行:
deactivate
exit
15. 检查运行状态
检查 ComfyUI 端口:
ss -lntp | grep 8188
检查进程:
pgrep -af 'python.*main.py'
检查显卡:
nvidia-smi
实时观察 GPU:
watch -n 1 nvidia-smi
按 Ctrl+C 退出观察。
16. 使用 MiniMax-H3 工作流
启动 ComfyUI 后,在页面中选择:
Workflow
→ Browse Templates
→ Video
→ MiniMax H3 Text to Video
可使用的官方工作流包括:
- MiniMax-H3 Text to Video
- MiniMax-H3 Image to Video
- MiniMax-H3 First and Last Frame
- MiniMax-H3 Reference to Video(需要对应参考模型)
首次测试建议:
模式:Text to Video
分辨率:864×480
帧率:24 FPS
帧数:124
时长:约 5 秒
Steps:20
CFG:1
首次运行先使用官方原生工作流,不安装 SageAttention、Turbo LoRA 或其他第三方加速节点。
生成结果默认保存在:
/data/ComfyUI/output/
输入图片放在:
/data/ComfyUI/input/
17. 日常启动流程
前台运行
cd /data/ComfyUI
source .venv/bin/activate
python main.py --listen 0.0.0.0 --port 8188 --enable-manager
停止:按 Ctrl+C。
退出虚拟环境:
deactivate
后台运行
tmux new -s comfyui
cd /data/ComfyUI
source .venv/bin/activate
python main.py --listen 0.0.0.0 --port 8188 --enable-manager
然后按 Ctrl+B、D 离开 tmux。
18. 更新 ComfyUI
更新前先停止正在运行的 ComfyUI,然后执行:
cd /data/ComfyUI
source .venv/bin/activate
git pull --ff-only
python -m pip install -r requirements.txt
python -m pip install -r manager_requirements.txt
git log -1 --oneline
19. 常见问题
19.1 CUDA 不可用
检查驱动:
nvidia-smi
检查 PyTorch:
cd /data/ComfyUI
source .venv/bin/activate
python -c "import torch; print(torch.__version__, torch.version.cuda, torch.cuda.is_available())"
正常结果必须包含 True。
19.2 页面无法打开
ss -lntp | grep 8188
hostname -I
如果启用了 UFW,只允许局域网访问:
sudo ufw allow from 192.168.1.0/24 to any port 8188 proto tcp
不要把 8188 直接暴露到公网。
19.3 显存不足
nvidia-smi
ollama ps
sudo systemctl stop ollama
首次测试降低分辨率、帧数和视频时长。
19.4 找不到模型
find /data/ComfyUI/models -type f -name '*minimax_h3*'
find /data/ComfyUI/models -type f -name '*qwen3vl*'
确认文件位置后重新启动 ComfyUI,使其重新扫描模型目录。
19.5 端口被占用
ss -lntp | grep 8188
pgrep -af 'python.*main.py'
如果已经有 ComfyUI 在运行,不要重复启动。
20. 暂不推荐的模型版本
完整 BF16 主模型
minimax_h3_fl2va_bf16.safetensors
暂不选择的原因:
- 文件约 66GB。
- 超过 RTX 5090 D 的 32GB 显存。
- 会产生较大的系统内存交换压力。
- 不适合作为首次稳定性测试版本。
完整 INT8 主模型
minimax_h3_fl2va_int8_convrot.safetensors
暂不选择的原因:
- 比 pruned INT8 版本更大。
- 对显存和系统内存要求更高。
- 虽可能保留更多复杂运动细节,但首次部署优先保证稳定。
Pruned FP8 主模型
minimax_h3_fl2va_pruned_fp8_scaled.safetensors
暂不优先选择的原因:
- FP8 在部分环境中可能更快。
- 性能会受到 PyTorch、注意力后端和工作流配置影响。
- 当前先用官方模板使用的 INT8 ConvRot 组合排除兼容性问题。
- 基础工作流稳定后,可以再比较 INT8 和 FP8。
21. 重要路径汇总
ComfyUI 目录: /data/ComfyUI
虚拟环境: /data/ComfyUI/.venv
模型目录: /data/ComfyUI/models
主模型目录: /data/ComfyUI/models/diffusion_models
文本编码器目录: /data/ComfyUI/models/text_encoders
VAE 目录: /data/ComfyUI/models/vae
输入文件: /data/ComfyUI/input
生成结果: /data/ComfyUI/output
自定义节点: /data/ComfyUI/custom_nodes
启动文件: /data/ComfyUI/main.py
Web 端口: 8188
22. 官方资源
- ComfyUI 官方仓库
- ComfyUI 官方文档
- MiniMax-H3 ComfyUI 模型
- ComfyUI 官方工作流
- MiniMax-H3 官方介绍
- ComfyUI 官方仓库
- MiniMax-H3 官方 ComfyUI 工作流
- MiniMax-H3 ComfyUI 模型文件
后续视频生成中,生成完再发上来..
