分类导航4
Minimax H3
MiniMax 于 2026年8月3日 正式开源的通用视频模型,开源版本支持 4-15s 768P 音视频生成。提供 FL2VA(文本/首尾帧生成)和 Ref2VA(全模态参考生成)两种变体。完整的 H3 系统由 H3-Context-IR(多阶段工作流,未开源)、H3-Base(核心,开源)、H3-Regenerate-2K(生成 2K 分辨率,尚未开源,后续可能会)组成。其核心 H3-Omni-Transformer 采用 33B 参数的稠密单流 Transformer 架构。借助社区量化模型和加速 LoRA,可进一步降低消费级显卡的本地部署门槛。
介绍
1 项内容H3 提示词写作技巧
4 项内容基础知识
MiniMax H3 提示词基础知识,包括 T2VA、I2VA、FL2VA、L2VA 和 Full-Reference 任务模式、提示词字段结构以及多模态描述的基本写作原则。
- H3-Base-FL2VA 对应 Base Model 的 4 种模式: T2VA、I2VA、FL2VA、L2VA,H3-Base-Ref2VA 对应 Full-Reference Mode 全参考模式;
- 提示词需要使用英文,对话、歌词、场景可见文字等保留原始语言;
- 优先使用具体的视觉和音频细节进行描述,避免使用“cinematic(电影感)”或“beautiful(唯美)”等抽象词汇。
SKILL.md
MiniMax H3 官方 SKILL.md 的中英文对照翻译,调整了部分格式,便于阅读和理解,Agent 实际使用时以原文为准。
- 整个 skills 有3个文件,SKILL.md、base-en.txt、ref-en.txt;
- 视频生成长度为 4-15秒;
- 可移植到任何能够读取本地文件的 Agent,无需调用外部 API、MiniMax Hub 工具或专有运行时;
base-en.txt
MiniMax H3 官方提供,适用于 Base Model 类型任务的规范 base-en.txt, 包含中文对照翻译,调整了部分格式,便于阅读和理解,Agent 实际使用时以原文为准。
- Base Model 模式有 4 种任务类型;
- 有3个核心字段,分别是:整体内容描述、环境声景、背景音乐;
- 镜头运动有3个维度:运动类型 + 幅度 + 速度;
ref-en.txt
MiniMax H3 官方提供,适用于 Full-Reference 全参考模式任务的规范 ref-en.txt,包含中文对照翻译,调整了部分格式,便于阅读和理解,Agent 实际使用时以原文为准。
- 全参考改写由六个部分组成,顺序为:主体定义、概述、保留分析、详细描述、整体声景、非画面内音乐;
- 四种参考标签:<Subject N> 是可复用可见内容,<Picture N> 是帧锚点,<Video N> 是视频结构来源,<Audio N> 是音频信号;
- 仅存在于直接复用 BGM 或完整音轨中的语言用 <Audio N>,由具体人物、角色或旁白实际发出的声音用 (Sx);
部署
2 项内容AutoDL 4090D 通过 ComfyUI 部署 MiniMax H3
在 AutoDL RTX 4090D 上通过 ComfyUI 部署 MiniMax H3,跑通 T2V、I2V、R2V 三个基础工作流,并说明 FL2VA/Ref2VA 模型关系、Comfy-Org 剪枝量化权重与部署步骤。
- T2V、I2V 共用 H3-Base-FL2VA,R2V 使用 H3-Base-Ref2VA;ComfyUI 实际加载的是 AdaLN Pruned + INT8 量化权重,不是官方完整 BF16;
- Video VAE、Audio VAE 和 Text Encoder 可共用,全部模型约 69.4GB,统一放在数据盘 /root/autodl-tmp;
- 无 GPU 需求时用无卡模式下载;优先 ModelScope,pip 安装依赖时需取消学术加速;
推理成本估算
通过 API 调用成本与 GPU 推理时间,快速估算 AI 模型的单次推理成本,并比较 API 与独立部署的成本差异。
- GPU 成本公式:每小时单价 * 推理时间 / 60;
- API 成本由调用量与计费单价决定;独立部署则可以根据 GPU 单价与实际推理时间快速估算单次任务成本;
- 对于文生图、文生视频等生成式 AI 模型,除了单次生成成本,还应关注生成一个合格产物所需的平均尝试次数;