Minimax H3

MiniMax 于 2026年8月3日 正式开源的通用视频模型,开源版本支持 4-15s 768P 音视频生成。提供 FL2VA(文本/首尾帧生成)和 Ref2VA(全模态参考生成)两种变体。完整的 H3 系统由 H3-Context-IR(多阶段工作流,未开源)、H3-Base(核心,开源)、H3-Regenerate-2K(生成 2K 分辨率,尚未开源,后续可能会)组成。其核心 H3-Omni-Transformer 采用 33B 参数的稠密单流 Transformer 架构。借助社区量化模型和加速 LoRA,可进一步降低消费级显卡的本地部署门槛。

介绍

1 项内容

H3 提示词写作技巧

4 项内容

基础知识

MiniMax H3 提示词基础知识,包括 T2VA、I2VA、FL2VA、L2VA 和 Full-Reference 任务模式、提示词字段结构以及多模态描述的基本写作原则。

  • H3-Base-FL2VA 对应 Base Model 的 4 种模式: T2VA、I2VA、FL2VA、L2VA,H3-Base-Ref2VA 对应 Full-Reference Mode 全参考模式;
  • 提示词需要使用英文,对话、歌词、场景可见文字等保留原始语言;
  • 优先使用具体的视觉和音频细节进行描述,避免使用“cinematic(电影感)”或“beautiful(唯美)”等抽象词汇。

SKILL.md

MiniMax H3 官方 SKILL.md 的中英文对照翻译,调整了部分格式,便于阅读和理解,Agent 实际使用时以原文为准。

  • 整个 skills 有3个文件,SKILL.md、base-en.txt、ref-en.txt;
  • 视频生成长度为 4-15秒;
  • 可移植到任何能够读取本地文件的 Agent,无需调用外部 API、MiniMax Hub 工具或专有运行时;

base-en.txt

MiniMax H3 官方提供,适用于 Base Model 类型任务的规范 base-en.txt, 包含中文对照翻译,调整了部分格式,便于阅读和理解,Agent 实际使用时以原文为准。

  • Base Model 模式有 4 种任务类型;
  • 有3个核心字段,分别是:整体内容描述、环境声景、背景音乐;
  • 镜头运动有3个维度:运动类型 + 幅度 + 速度;

ref-en.txt

MiniMax H3 官方提供,适用于 Full-Reference 全参考模式任务的规范 ref-en.txt,包含中文对照翻译,调整了部分格式,便于阅读和理解,Agent 实际使用时以原文为准。

  • 全参考改写由六个部分组成,顺序为:主体定义、概述、保留分析、详细描述、整体声景、非画面内音乐;
  • 四种参考标签:<Subject N> 是可复用可见内容,<Picture N> 是帧锚点,<Video N> 是视频结构来源,<Audio N> 是音频信号;
  • 仅存在于直接复用 BGM 或完整音轨中的语言用 <Audio N>,由具体人物、角色或旁白实际发出的声音用 (Sx);

部署

2 项内容

资源

1 项内容