ComfyUI + MiniMax-H3 部署与使用说明

本文由Codex生成

随着 MiniMax-H3 开放模型权重,个人用户也可以通过 ComfyUI 将这款全模态生成模型部署到本地显卡上。部署完成后,文生视频、图生视频、首尾帧控制、参考素材生成以及原生音视频联合生成,都可以在自己的服务器上完成。

MiniMax-H3 是什么?

MiniMax-H3 是一款面向内容创作的通用全模态生成模型。它能够统一理解由文本、图像、视频和声音共同组成的多模态上下文,并根据自然语言描述完成视频生成、参考和编辑。

传统视频模型通常把文生视频、图生视频、动作参考、角色参考、首尾帧控制、音色参考和视频编辑拆分成不同模型或不同功能。H3 的设计方向则是统一这些任务,让用户通过自然语言说明不同素材之间的关系。模型会尝试同时理解视频的镜头运动、图片中的人物形象、音频中的声音特征以及文本中的创作要求,而不只是简单地把几个独立模型串联起来。

根据 MiniMax 官方介绍,H3 最高支持生成 15 秒、2K 分辨率的内容,并且可以直接输出带有原生双声道声音的音视频。声音不是在视频完成后额外配上去的,而是作为生成过程的一部分,与画面联合建模,因此可用于对白、环境声、动作音效和音乐等内容。

通过 ComfyUI 可以做什么?

ComfyUI 是一套基于节点和工作流的生成式 AI 图形界面。模型加载、提示词编码、视频采样、画面解码、音频解码和文件输出,都可以通过可视化节点连接起来。

本地部署 MiniMax-H3 后,可以逐步实现以下工作流:

  • 文生视频:根据文字描述生成完整的视频镜头。
  • 图生视频:让静态人物、产品图或场景图动起来。
  • 首帧控制:从指定画面开始生成后续内容。
  • 首尾帧控制:指定视频起点和终点,由模型生成中间过程。
  • 参考生成:参考人物、风格、运镜、动作、视频或音频生成新内容。
  • 视频编辑:通过自然语言描述需要保留和修改的内容。
  • 原生音视频生成:同时生成画面、对白、环境声和动作音效。
  • 多镜头内容:在一段视频中表达镜头切换和连续叙事。

这意味着它不仅可以制作几秒钟的演示动画,还可以用于 AI 短剧、动态海报、影视分镜、产品广告、人物表演、音乐视频、游戏内容和电商素材。

本次部署方案

本次使用的主要硬件和软件环境为:

系统:Ubuntu Desktop 24.04
显卡:NVIDIA GeForce RTX 5090 D
显存:32GB
系统内存:约 128GB
推理框架:PyTorch + CUDA
操作界面:ComfyUI
模型:MiniMax-H3

考虑到完整 BF16 主模型约 66GB,单张 32GB 显卡无法完整容纳,因此采用更适合本机配置的量化组合:

H3 主模型:Pruned INT8 ConvRot
文本编码器:Qwen3-VL 32B NVFP4 AWQ
视频 VAE:FP16
音频 VAE:FP32

这套方案降低了显存和系统内存压力,同时保留 MiniMax-H3 的主要生成能力。ComfyUI 会在不同阶段加载文本编码器、视频主模型和 VAE,并在显存与系统内存之间进行调度。

适合 AI 短剧生产吗?

MiniMax-H3 能明显扩展 AI 短剧的制作空间,但目前更适合采用“分镜生成”的方式,而不是一次生成一整集。

一种实用流程是:

  1. 编写故事梗概、人物设定和场景设定。
  2. 将一集内容拆分成多个 5~15 秒的镜头。
  3. 为主要角色准备统一的参考图片、声音和提示词。
  4. 使用图生视频或参考生成完成单个镜头。
  5. 分别生成对白、环境声和动作画面。
  6. 选择效果较好的镜头进行放大、插帧和剪辑。
  7. 最后通过剪辑软件组合成完整短剧。

本地运行后,每个镜头都可以反复尝试,不必担心消耗在线平台积分。但角色跨镜头一致性、长时间连续叙事、复杂动作和稳定文字等问题,仍需要通过参考素材、固定提示词、工作流设计和后期剪辑来解决。

总结

ComfyUI + MiniMax-H3 提供了一条值得尝试的本地 AI 视频生产路线:ComfyUI 负责可视化编排和模型调度,MiniMax-H3 负责统一理解文本、图片、视频和声音,并生成带原生双声道声音的视频内容。

它不能完全取代导演、剪辑和后期制作,也不能保证每次生成都能直接使用,但本地模型让创作者摆脱了在线平台次数和 API 余额的限制,可以围绕同一个角色、镜头或短剧项目持续试验。

对于拥有高性能 NVIDIA 显卡的用户而言,这不仅是一个文生视频工具,也可以逐渐扩展成一套由自己掌控的全模态内容创作工作站。


1. 当前服务器配置

系统:Ubuntu Desktop 24.04
GPU:NVIDIA GeForce RTX 5090 D
显存:32GB
系统内存:约 128GB
NVIDIA 驱动:595.84
Python:3.12
PyTorch:2.13.0 + CUDA 13.0
ComfyUI 目录:/data/ComfyUI
虚拟环境:/data/ComfyUI/.venv
Web 端口:8188

安装与运行 ComfyUI 使用普通用户权限,不要使用 root 用户运行。

PyTorch 安装包已经包含所需 CUDA Runtime。仅为运行 ComfyUI,无需单独安装完整 CUDA Toolkit。


2. 安装系统依赖

sudo apt update

sudo apt install -y \
  git \
  git-lfs \
  ffmpeg \
  python3.12-venv \
  wget \
  tmux

git lfs install

3. 设置网络代理(可选)

如果 GitHub、Hugging Face 或 PyTorch 下载失败,并且 v2rayN 的 HTTP 代理端口为 10808,在当前终端执行:

export http_proxy=http://127.0.0.1:10808
export https_proxy=http://127.0.0.1:10808
export HTTP_PROXY=http://127.0.0.1:10808
export HTTPS_PROXY=http://127.0.0.1:10808
export NO_PROXY=localhost,127.0.0.1

检查代理端口:

ss -lntp | grep 10808

这些代理变量只对当前终端有效。打开新的 SSH 终端后,需要重新设置。


4. 安装 ComfyUI

4.1 创建目录

sudo mkdir -p /data/ComfyUI
sudo chown dabai:dabai /data/ComfyUI

4.2 下载 ComfyUI

git -c http.version=HTTP/1.1 clone --depth=1 \
  https://github.com/Comfy-Org/ComfyUI.git \
  /data/ComfyUI

如果 /data/ComfyUI 已经包含完整仓库,不要重复克隆。

检查仓库:

cd /data/ComfyUI

git status
git log -1 --oneline
test -f main.py && echo "ComfyUI 仓库完整"

5. 创建独立虚拟环境

进入 ComfyUI 目录:

cd /data/ComfyUI

创建 Python 3.12 虚拟环境:

python3.12 -m venv .venv

进入虚拟环境:

source /data/ComfyUI/.venv/bin/activate

进入成功后,终端提示符前面会出现 (.venv),例如:

(.venv) dabai@dabai-AI:/data/ComfyUI$

升级 Python 安装工具:

python -m pip install --upgrade pip setuptools wheel

5.1 退出虚拟环境

deactivate

退出后,终端前面的 (.venv) 会消失。

5.2 再次进入虚拟环境

cd /data/ComfyUI
source .venv/bin/activate

关闭终端、断开 SSH 或退出虚拟环境,都不会删除 .venv


6. 安装 PyTorch 和 ComfyUI 依赖

先进入虚拟环境:

cd /data/ComfyUI
source .venv/bin/activate

安装 CUDA 13.0 版 PyTorch:

python -m pip install \
  torch \
  torchvision \
  torchaudio \
  --index-url https://download.pytorch.org/whl/cu130

安装 ComfyUI 依赖:

python -m pip install -r requirements.txt

安装内置 Manager 所需依赖:

python -m pip install -r manager_requirements.txt

6.1 验证 PyTorch 和显卡

python -c "import torch; print('PyTorch:', torch.__version__); print('CUDA:', torch.version.cuda); print('CUDA 可用:', torch.cuda.is_available()); print('GPU:', torch.cuda.get_device_name(0))"

当前服务器正常输出应类似:

PyTorch: 2.13.0+cu130
CUDA: 13.0
CUDA 可用: True
GPU: NVIDIA GeForce RTX 5090 D

检查 NVIDIA 驱动:

nvidia-smi

7. MiniMax-H3 模型选择说明

7.1 为什么选择这四个模型

当前服务器是 RTX 5090 D,拥有 32GB 显存和约 128GB 系统内存。

MiniMax-H3 完整 BF16 主模型约 66GB,无法完整放入 32GB 显存。首次部署选择官方工作流使用的低显存组合:

主模型:Pruned INT8 ConvRot
文本编码器:Qwen3-VL 32B NVFP4 AWQ
视频 VAE:FP16
音频 VAE:FP32

这套组合具有以下特点:

  • 适合 RTX 5090 D 的 32GB 显存。
  • 主模型约 21GB,比完整 BF16 版更容易运行。
  • NVFP4 文本编码器适合 RTX 50 系列 Blackwell 显卡。
  • 支持文本生成视频和图片生成视频。
  • 支持视频与同步音频生成。
  • 由最新版 ComfyUI 原生支持。
  • 不需要安装第三方模型加载节点。
  • ComfyUI 会按阶段在显存和系统内存之间调度模型。

pruned 版本通过移除推理时不需要的权重降低文件大小。与完整 BF16 模型相比,复杂运动、物理效果及微小背景细节可能略有损失,但更适合单张 32GB 显卡。


8. 四个模型的用途

8.1 MiniMax-H3 视频生成主模型

文件:

minimax_h3_fl2va_pruned_int8_convrot.safetensors

目录:

/data/ComfyUI/models/diffusion_models/

预计大小约 21GB。

用途:

  • MiniMax-H3 的核心视频生成模型。
  • 根据提示词和输入图片生成视频潜空间数据。
  • 生成供视频 VAE 和音频 VAE 解码的数据。
  • 用于官方文本生成视频和图片生成视频工作流。

文件名含义:

  • fl2va:用于帧、文本等条件到视频与音频的生成任务。
  • pruned:移除了推理时不需要的权重。
  • int8:使用 8 位量化,降低显存和内存占用。
  • convrot:使用 ComfyUI 支持的低精度旋转量化格式。

选择原因:

  • 完整 BF16 主模型约 66GB,不适合 32GB 显存。
  • 完整 INT8 版本仍然较大。
  • Pruned INT8 版本约 21GB,更适合 RTX 5090 D。
  • 在画质、显存占用和运行稳定性之间比较均衡。

8.2 Qwen3-VL 文本与图像编码器

文件:

qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

目录:

/data/ComfyUI/models/text_encoders/

预计大小约 16GB。

用途:

  • 理解文本提示词。
  • 理解输入图片和视觉条件。
  • 把文本及图片转换成 H3 主模型能够使用的特征。
  • 理解人物、场景、动作、镜头、声音和对白等指令。

文件名含义:

  • qwen3vl_32b:采用 32B 规模的 Qwen3-VL 多模态编码器。
  • minimax_h3:已经适配 MiniMax-H3。
  • nvfp4:采用 NVIDIA 4 位浮点格式。
  • awq:采用 AWQ 量化方式降低资源占用。

选择原因:

  • 完整精度的 32B 编码器资源占用很大。
  • NVFP4 大幅降低显存和系统内存压力。
  • RTX 5090 D 属于 Blackwell 架构,适合 NVFP4。
  • 官方 MiniMax-H3 模板使用该版本。
  • 文本编码完成后,ComfyUI 可以卸载编码器并加载视频主模型。

8.3 MiniMax-H3 视频 VAE

文件:

minimax_h3_video_vae_fp16.safetensors

目录:

/data/ComfyUI/models/vae/

用途:

  • 将主模型生成的视频潜空间数据解码为实际视频画面。
  • 在图生视频任务中编码输入图片。
  • 影响最终视频的颜色、亮度和画面细节。

选择 FP16 的原因:

  • 比 FP32 节省约一半内存。
  • 比过度量化的 VAE 更不容易出现色块或解码异常。
  • RTX 5090 D 对 FP16 有良好支持。
  • 是画质、速度和显存占用之间的稳定选择。

8.4 MiniMax-H3 音频 VAE

文件:

minimax_h3_audio_vae_fp32.safetensors

目录:

/data/ComfyUI/models/vae/

用途:

  • 将音频潜空间数据解码成真实声音。
  • 生成与视频同步的对白、环境声和动作声。
  • 由工作流将视频和音频合成为带声音的视频。

选择 FP32 的原因:

  • 音频解码对数值误差比较敏感。
  • 低精度可能产生杂音、爆音、失真或静音。
  • 音频 VAE 本身相对较小,使用 FP32 不会造成太大的资源压力。
  • 官方工作流指定使用该版本。

9. 四个模型之间的关系

四个文件不是四个任选其一的模型,而是一套完整的生成组件:

文本提示词/输入图片
        │
        ▼
Qwen3-VL 文本与图像编码器
        │
        ▼
MiniMax-H3 视频生成主模型
        │
        ├── 视频潜空间 ──► 视频 VAE ──► 视频画面
        │
        └── 音频潜空间 ──► 音频 VAE ──► 同步声音
缺少的文件 影响
H3 主模型 无法生成视频
Qwen3-VL 编码器 无法正确理解提示词和输入图片
视频 VAE 无法解码视频画面
音频 VAE 无法生成或解码同步音频

如果只需要无声视频,可以修改工作流跳过音频部分。但官方默认工作流会使用音频 VAE,因此建议四个文件全部下载。


10. 当前模型支持范围

当前下载的是 fl2va 主模型,主要用于:

  • Text to Video:文本生成视频
  • Image to Video:图片生成视频
  • First Frame:首帧控制
  • First and Last Frame:首尾帧控制
  • 原生同步音频生成

复杂的 Reference to Video、多参考素材或视频动作参考工作流,可能还需要:

minimax_h3_ref2va_pruned_int8_convrot.safetensors

ref2va 不包含在当前基础四文件中。建议先运行稳定 fl2va 工作流,再按需求增加参考模型。


11. 下载 MiniMax-H3 模型

11.1 安装 Hugging Face 工具

进入虚拟环境:

cd /data/ComfyUI
source .venv/bin/activate

安装下载工具:

python -m pip install -U huggingface_hub

验证:

hf --help

11.2 创建模型目录

cd /data/ComfyUI

mkdir -p models/diffusion_models
mkdir -p models/text_encoders
mkdir -p models/vae

11.3 下载四个模型

如果需要代理,先设置代理变量,然后执行:

hf download Comfy-Org/MiniMax-H3 \
  diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  vae/minimax_h3_video_vae_fp16.safetensors \
  vae/minimax_h3_audio_vae_fp32.safetensors \
  --local-dir /data/ComfyUI/models

下载约数十 GB,可能需要较长时间。下载中断后,重新执行相同命令即可,工具会复用已经完成的文件并继续下载。

查看下载占用:

watch -n 5 'du -sh /data/ComfyUI/models; df -h /'

Ctrl+C 退出观察。

11.4 下载完成后的目录

/data/ComfyUI/models/
├── diffusion_models/
│   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
├── text_encoders/
│   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└── vae/
    ├── minimax_h3_video_vae_fp16.safetensors
    └── minimax_h3_audio_vae_fp32.safetensors

11.5 检查模型文件

ls -lh \
  /data/ComfyUI/models/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  /data/ComfyUI/models/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  /data/ComfyUI/models/vae/minimax_h3_video_vae_fp16.safetensors \
  /data/ComfyUI/models/vae/minimax_h3_audio_vae_fp32.safetensors

检查模型总大小:

du -sh /data/ComfyUI/models

12. 前台启动 ComfyUI

如果 Ollama 正在占用显存,可以先停止:

sudo systemctl stop ollama

进入虚拟环境:

cd /data/ComfyUI
source .venv/bin/activate

启动:

python main.py \
  --listen 0.0.0.0 \
  --port 8188 \
  --enable-manager

看到以下提示表示启动成功:

Starting server
To see the GUI go to: http://0.0.0.0:8188

查看服务器 IP:

hostname -I

在其他电脑浏览器访问:

http://服务器IP:8188

例如:

http://192.168.1.XX:8188

13. 停止和退出 ComfyUI

如果 ComfyUI 正在当前终端前台运行,按:

Ctrl+C

停止后退出虚拟环境:

deactivate

退出 SSH:

exit

14. 使用 tmux 后台运行

使用 tmux 后,即使断开 SSH,ComfyUI 也会继续运行。

14.1 创建 tmux 会话

tmux new -s comfyui

14.2 在 tmux 中启动 ComfyUI

cd /data/ComfyUI
source .venv/bin/activate

python main.py \
  --listen 0.0.0.0 \
  --port 8188 \
  --enable-manager

14.3 离开 tmux 但保持运行

依次按下:

Ctrl+B
D

14.4 重新进入 ComfyUI 会话

tmux attach -t comfyui

14.5 查看所有 tmux 会话

tmux ls

14.6 停止后台 ComfyUI

进入 tmux:

tmux attach -t comfyui

Ctrl+C 停止 ComfyUI,然后执行:

deactivate
exit

15. 检查运行状态

检查 ComfyUI 端口:

ss -lntp | grep 8188

检查进程:

pgrep -af 'python.*main.py'

检查显卡:

nvidia-smi

实时观察 GPU:

watch -n 1 nvidia-smi

Ctrl+C 退出观察。


16. 使用 MiniMax-H3 工作流

启动 ComfyUI 后,在页面中选择:

Workflow
→ Browse Templates
→ Video
→ MiniMax H3 Text to Video

可使用的官方工作流包括:

  • MiniMax-H3 Text to Video
  • MiniMax-H3 Image to Video
  • MiniMax-H3 First and Last Frame
  • MiniMax-H3 Reference to Video(需要对应参考模型)

首次测试建议:

模式:Text to Video
分辨率:864×480
帧率:24 FPS
帧数:124
时长:约 5 秒
Steps:20
CFG:1

首次运行先使用官方原生工作流,不安装 SageAttention、Turbo LoRA 或其他第三方加速节点。

生成结果默认保存在:

/data/ComfyUI/output/

输入图片放在:

/data/ComfyUI/input/

17. 日常启动流程

前台运行

cd /data/ComfyUI
source .venv/bin/activate
python main.py --listen 0.0.0.0 --port 8188 --enable-manager

停止:按 Ctrl+C

退出虚拟环境:

deactivate

后台运行

tmux new -s comfyui
cd /data/ComfyUI
source .venv/bin/activate
python main.py --listen 0.0.0.0 --port 8188 --enable-manager

然后按 Ctrl+BD 离开 tmux。


18. 更新 ComfyUI

更新前先停止正在运行的 ComfyUI,然后执行:

cd /data/ComfyUI
source .venv/bin/activate

git pull --ff-only
python -m pip install -r requirements.txt
python -m pip install -r manager_requirements.txt

git log -1 --oneline

19. 常见问题

19.1 CUDA 不可用

检查驱动:

nvidia-smi

检查 PyTorch:

cd /data/ComfyUI
source .venv/bin/activate
python -c "import torch; print(torch.__version__, torch.version.cuda, torch.cuda.is_available())"

正常结果必须包含 True

19.2 页面无法打开

ss -lntp | grep 8188
hostname -I

如果启用了 UFW,只允许局域网访问:

sudo ufw allow from 192.168.1.0/24 to any port 8188 proto tcp

不要把 8188 直接暴露到公网。

19.3 显存不足

nvidia-smi
ollama ps
sudo systemctl stop ollama

首次测试降低分辨率、帧数和视频时长。

19.4 找不到模型

find /data/ComfyUI/models -type f -name '*minimax_h3*'
find /data/ComfyUI/models -type f -name '*qwen3vl*'

确认文件位置后重新启动 ComfyUI,使其重新扫描模型目录。

19.5 端口被占用

ss -lntp | grep 8188
pgrep -af 'python.*main.py'

如果已经有 ComfyUI 在运行,不要重复启动。


20. 暂不推荐的模型版本

完整 BF16 主模型

minimax_h3_fl2va_bf16.safetensors

暂不选择的原因:

  • 文件约 66GB。
  • 超过 RTX 5090 D 的 32GB 显存。
  • 会产生较大的系统内存交换压力。
  • 不适合作为首次稳定性测试版本。

完整 INT8 主模型

minimax_h3_fl2va_int8_convrot.safetensors

暂不选择的原因:

  • 比 pruned INT8 版本更大。
  • 对显存和系统内存要求更高。
  • 虽可能保留更多复杂运动细节,但首次部署优先保证稳定。

Pruned FP8 主模型

minimax_h3_fl2va_pruned_fp8_scaled.safetensors

暂不优先选择的原因:

  • FP8 在部分环境中可能更快。
  • 性能会受到 PyTorch、注意力后端和工作流配置影响。
  • 当前先用官方模板使用的 INT8 ConvRot 组合排除兼容性问题。
  • 基础工作流稳定后,可以再比较 INT8 和 FP8。

21. 重要路径汇总

ComfyUI 目录:     /data/ComfyUI
虚拟环境:         /data/ComfyUI/.venv
模型目录:         /data/ComfyUI/models
主模型目录:       /data/ComfyUI/models/diffusion_models
文本编码器目录:   /data/ComfyUI/models/text_encoders
VAE 目录:         /data/ComfyUI/models/vae
输入文件:         /data/ComfyUI/input
生成结果:         /data/ComfyUI/output
自定义节点:       /data/ComfyUI/custom_nodes
启动文件:         /data/ComfyUI/main.py
Web 端口:         8188

22. 官方资源

后续视频生成中,生成完再发上来..