目标
AutoDL 4090D 实例部署 ComfyUI,分别执行 MiniMax H3 文生视频(T2V)、图生视频(I2V)和参考生视频(R2V)三个基础 MiniMax H3 模板工作流。
后续的部署、推理测试和工作流调整,均以这三个基础模板为起点进行。
模型关系
MiniMax H3 Base Model 官方提供两个模型变种:
-
H3-Base-FL2VA:支持 T2VA、I2VA、FL2VA、L2VA 等基础生成模式。
-
H3-Base-Ref2VA:用于 Full-Reference Mode,可通过参考图片、视频和音频进行生成。
ComfyUI 的三个基础工作流对应两个底层模型变种:
| ComfyUI 工作流 | 生成模式 | 对应模型 |
|---|---|---|
| T2V | Text → Video + Audio | H3-Base-FL2VA |
| I2V | Image → Video + Audio | H3-Base-FL2VA |
| R2V | Reference → Video + Audio | H3-Base-Ref2VA |
其中:
-
T2V 和 I2V 共用 FL2VA 主模型,主要区别在于输入条件和工作流节点;
-
R2V 则需要使用 Ref2VA 主模型。
ComfyUI 使用的模型权重
ComfyUI不直接加载 MiniMax 官方发布的完整 BF16 checkpoint。
ComfyUI 模板使用了 Comfy-Org 重新整理的模型权重,并使用 AdaLN Pruned + INT8 量化版本的主 Diffusion Model,以降低模型加载所需的显存和内存。
H3 完整的 33B H3-Omni-Transformer 中约 13B 参数位于 AdaLN 相关分支;由于其调制输出可预计算并缓存,纯推理部署时可以移除这些分支参数,仅保留约 20B 的主要推理参数。它属于针对 H3 架构的结构性推理优化,与 INT8/FP8 等权重量化是不同的优化手段。
“在 4090D 上运行 MiniMax H3”,准确说是:在 RTX 4090D 24 GB 环境中,通过 ComfyUI 运行 MiniMax H3 的 AdaLN Pruned + INT8 量化权重,而不是直接运行官方完整 BF16 权重。
模型组件
三个工作流的整体模型组件基本一致,区别在于加载的 Diffusion Model 和可选的 Turbo LoRA。
| 组件 | T2V | I2V | R2V |
|---|---|---|---|
| Diffusion Model | FL2VA Pruned INT8 | FL2VA Pruned INT8 | Ref2VA Pruned INT8 |
| Text Encoder | Qwen3-VL 32B NVFP4 AWQ | 相同 | 相同 |
| Video VAE | FP16 | 相同 | 相同 |
| Audio VAE | FP32 | 相同 | 相同 |
| Turbo LoRA | 4step/8step | 4step/8step | 4step |
-
Video VAE、Audio VAE 和 Text Encoder 可以共用;
-
T2V 与 I2V 进一步共用同一个 FL2VA Diffusion Model;
-
R2V 只需要切换为 Ref2VA Diffusion Model;
模型文件下载链接
VAE
minimax_h3_video_vae_fp16.safetensors 5.21GB:
minimax_h3_audio_vae_fp32.safetensors 605 MB:
Text Encoder
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors 15.7 GB:
diffusion model
minimax_h3_fl2va_pruned_int8_convrot.safetensors 21GB:
minimax_h3_ref2va_pruned_int8_convrot.safetensors 21GB:
LoRA
minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors 1.96GB:
minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors 1.96GB:
minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensors 1.96GB:
模型目录
下载所有的模型占用的空间为:69.395GB,对应 ComfyUI 目录如下:
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 vae/
│ │ ├── minimax_h3_video_vae_fp16.safetensors
│ │ └── minimax_h3_audio_vae_fp32.safetensors
│ ├── 📂 diffusion_models/
| | |-- minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 loras/
│ └── minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors
│ └── minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors
│ └── minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensorsT2V、I2V、R2V 是工作流/任务层面的区别,FL2VA、Ref2VA 才是底层主模型变种的区别。
运行环境
在 AutoDL 通过按量计费的方式租用 RTX 4090D 实例,4090D 比较适合以 模型部署、功能验证和推理测试 为主的场景,在性能、显存和租用成本之间具有较好的平衡。
-
RTX 4090D 配备 24 GB 显存,具备较强的生成式 AI 推理性能,内存通常在 60 GB 以上,可以通过 Offload 的方式利用内存加载模型权重。
-
目前实例价格约 ¥1.98/小时,相比 RRO 6000、A800 等7、8元/小时的显卡型号,部署和测试成本更低。
-
MiniMax H3 模型规模较大,24 GB 显存并不能直接容纳完整模型,但借助 量化、LoRA、CPU Offload 等方式,可以在 4090D 上运行部分 H3 推理方案。
-
系统盘30 GB,数据盘默认 50GB,若下载所有模型权重和环境依赖等,考虑 75 GB,即:扩容 25 GB。
AutoDL 实例配置:
-
GPU:NVIDIA RTX 4090D 24 GB
-
价格:约 ¥1.98/小时,以创建实例时的实际价格为准
-
镜像:PyTorch 2.12.1 / Python 3.12 / CUDA 13.0
-
系统:Ubuntu 22.04.5 LTS
-
扩容:25 GB,0.0070元/日/GB,每天 ¥0.18/日,无论关机与否,都按实际使用量计费,一周 ¥1.26。
直接选择 PyTorch 基础镜像,可以省去 NVIDIA 驱动、CUDA、Python 和 PyTorch 等基础环境的安装配置,在此基础上安装 ComfyUI 及相关依赖即可。
ComfyUI、模型权重以及生成结果等大容量文件统一存放在 AutoDL 数据盘:/root/autodl-tmp,比如:/root/autodl-tmp/ComfyUI
模型的 Diffusion Model、Text Encoder、VAE、LoRA 等文件体积较大,放在数据盘可以避免占用系统盘,同时便于后续扩容和统一管理。
部署过程
省钱、网络、缓存配置
-
下载模型、环境配置等耗时操作等不需要
GPU场景时,可以关机后使用无卡模式,更多参见:AutoDL帮助文档:省钱绝招;- 无卡模式开机后使用:0.5核、2GB内存、价格统一为
0.1 元/小时,对于之前和之后的数据均无影响;
- 无卡模式开机后使用:0.5核、2GB内存、价格统一为
-
下载模型时,如果 魔搭社区 modelscope 有对应模型,优先选择使用 modelscope 下载,速度会很快,需要安装 ModelScope Library;
-
1.9GB 耗时 1m54s,速度可以达到 18MB/s;
-
若网盘无会员或个人认证用户,模型下载优先使用魔搭社区下载;
-
-
若需要访问 Github、HuggingFace,可以开启学术加速:
source /etc/network_turbo- 但是由于 pip 等配置的都是国内的镜像地址,如阿里云、清华源,当需要使用 pip 等安装依赖,最好取消学术加速,否则速度会很慢:
unset http_proxy && unset https_proxy- 通过 SSH 远程连接容器实例,具体参见:AutoDL帮助文档:SSH远程连接
设置 HuggingFace / torch / ModelScope 缓存目录
目的:避免后续下载模型将系统盘占满。
- 创建目录
mkdir -p /root/autodl-tmp/cache/huggingface
mkdir -p /root/autodl-tmp/cache/torch
mkdir -p /root/autodl-tmp/cache/modelscope- 设置环境变量,打开
~/.bashrc文件,
vi ~/.bashrc- 按
i键进入编辑模式,在文件最后添加以下内容:
export HF_HOME=/root/autodl-tmp/cache/huggingface
export TORCH_HOME=/root/autodl-tmp/cache/torch
export MODELSCOPE_HOME=/root/autodl-tmp/cache/modelscope-
按
Esc键退出编辑模式,输入:wq保存并退出; -
关闭当前终端并重新登录,然后验证:
echo $HF_HOME
echo $TORCH_HOME
echo $MODELSCOPE_HOME- 输出类似:
/root/autodl-tmp/cache/huggingface
/root/autodl-tmp/cache/torch
/root/autodl-tmp/cache/modelscope环境初始化
- 确认 GPU
nvidia-smi
# 输出类似:
NVIDIA GeForce RTX 4090 D On- 根据 Conda 创建专有环境,所选的镜像已经安装了 mini conda,直接创建专属 ComfyUI 环境:
conda create -n comfyui python=3.12 -y
# 初始化
conda init- 退出当前终端并重新登录,然后激活环境:
conda activate comfyui
which python
python --version- 安装 PyTorch,不要开启学术加速,大约需要 16 分钟;
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130- 验证:
python -c "import torch; print('PyTorch:', torch.__version__); print('CUDA:', torch.version.cuda); print('CUDA available:', torch.cuda.is_available()); print('GPU:', torch.cuda.get_device_name(0) if torch.cuda.is_available() else None)"
# 输出类似:
PyTorch: 2.14.0+cu130
CUDA: 13.0
CUDA available: True
GPU: NVIDIA GeForce RTX 4090 D安装 ComfyUI
注意:使用的是 ComfyUI ,而不是 Comfy Desktop。
ComfyUI 是生成式 AI 的基于节点的引擎。
Comfy Desktop 是一个安装、管理和启动多个 ComfyUI 实例的桌面应用;
- 进入数据盘目录
cd /root/autodl-tmp- 开启学术加速
source /etc/network_turbo- 克隆仓库
git clone --depth 1 https://github.com/Comfy-Org/ComfyUI.git--depth 1 表示只克隆最新的 commit,不克隆历史 commit,可以加快克隆速度。
- 克隆完成后,进入 ComfyUI 目录:
cd ComfyUI- 取消学术加速,pip 使用国内镜像,安装依赖,大约需要 7 分钟;
unset http_proxy && unset https_proxy
pip install -r requirements.txt- 启动应用,指定端口为 6006,或者 6008,只能使用 6006 或 6008 这两个端口,便于后续访问,具体参见:AutoDL帮助文档:开放端口
python main.py --port 6006
# 输出类似:
...
[INFO] 0.0 seconds: /root/autodl-tmp/ComfyUI/custom_nodes/websocket_image_save.py
[INFO]
[INFO] Context impl SQLiteImpl.
[INFO] Will assume non-transactional DDL.
[INFO] Using RAM pressure cache.
[INFO] Starting server
[INFO] To see the GUI go to: http://127.0.0.1:6006-
若开启了企业认证,可以直接访问实例 6006 或 6008 端口映射的公网访问地址,具体参见:AutoDL帮助文档:开放端口
-
个人的话,需要通过 SSH 隧道的方式,具体参见:AutoDL帮助文档:SSH 隧道
-
以下以 SSH 隧道的方式访问 ComfyUI 为例,开启新终端,通过隧道访问 ComfyUI:
ssh -CNg -L 6006:127.0.0.1:6006 [email protected] -p 11244
# 输入密码- 在本机浏览器访问:http://127.0.0.1:6006,即可看到 ComfyUI 的界面。
模型下载
即使开启了学术加速,使用 huggingface 的方式进行下载速度依然很慢,如果在 ModelScope 有对应模型,优先使用 ModelScope 下载,速度会很快,需要安装 ModelScope Library,注意取消学术加速,否则速度会很慢:
unset http_proxy && unset https_proxy
pip install modelscope- 下载模型
# 命令格式
modelscope download --model `仓库名称` `模型路径` --local_dir `本地路径`示例:
modelscope download --model 'Comfy-Org/MiniMax-H3' 'loras/minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensors' --local_dir '/root/autodl-tmp/ComfyUI/models'由于模型路径已经有了相对路径 loras/... ,所以本地路径只需要指定到 ComfyUI/models 目录即可。
- 完整的下载命令:
# vae
modelscope download --model 'Comfy-Org/MiniMax-H3' 'vae/minimax_h3_audio_vae_fp32.safetensors' --local_dir '/root/autodl-tmp/ComfyUI/models'
modelscope download --model 'Comfy-Org/MiniMax-H3' 'vae/minimax_h3_video_vae_fp16.safetensors' --local_dir '/root/autodl-tmp/ComfyUI/models'
# text_encoders
modelscope download --model 'Comfy-Org/MiniMax-H3' 'text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors' --local_dir '/root/autodl-tmp/ComfyUI/models'
# diffusion_models
modelscope download --model 'Comfy-Org/MiniMax-H3' 'diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors' --local_dir '/root/autodl-tmp/ComfyUI/models'
modelscope download --model 'Comfy-Org/MiniMax-H3' 'diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors' --local_dir '/root/autodl-tmp/ComfyUI/models'
# loras
modelscope download --model 'Comfy-Org/MiniMax-H3' 'loras/minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensors' --local_dir '/root/autodl-tmp/ComfyUI/models'
modelscope download --model 'Comfy-Org/MiniMax-H3' 'loras/minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors' --local_dir '/root/autodl-tmp/ComfyUI/models'
modelscope download --model 'Comfy-Org/MiniMax-H3' 'loras/minimax_h3_ref2v_turbo_8step_v1.0_comfyui_bf16.safetensors' --local_dir '/root/autodl-tmp/ComfyUI/models'验证
- 在本地浏览器的 ComfyUI 界面,点击模版,打开 I2V 工作流,点击生成,没有出现错误,开始生成,等待生成完成,即可看到生成结果。