任务模式
MiniMax H3 提供了两种模型变体,
- H3-Base-FL2VA
- H3-Base-Ref2VA
分别对应 Base Model 基础模式 和 Full-Reference Mode 全参考模式。
Base Model 共有 4 种模式:
使用如下字段:
integrated_multimodal_description,综合多模态描述;overall_soundscape,整体声景;non_diegetic_music,非画面内音乐;
T2VA
- Text to Vide and Audio,即:文本 -> 视频 + 音频;
- 从文本直接构建完整的视听时间线。
I2VA
- Image to Vide and Audio,即:文本 + 图像 -> 视频 + 音频;
- Image 承担首帧角色,从给定首帧开始向后生成。
- 沿用成熟的 I2V(Image-to-Video) 概念,给一张图片作为起始画面,然后让视频从这张图片继续发展。
- I2VA 的 I 描述的是输入模态(Image)。
FL2VA
- First and Last frame to Video and Audio,即:首帧和末帧 -> 视频 + 音频。
- 首帧和尾帧都给定,模型负责生成二者之间连续的视听过程。
L2VA
- Last frame to Video and Audio,即:末帧 -> 视频 + 音频。
- 给定尾帧,模型推断合理的起始场景,并生成逐步过渡至该尾帧的连续视听过程。
- L2VA 的 L 描述的是输入图片在时间轴上的位置(Last)。
Full-Reference Mode
按照顺序使用的字段有:
- subject_definitions
- summary
- retention_analysis
- detailed_description
- overall_soundscape
- non_diegetic_music
字段说明
| 字段 | 中文翻译 | 说明 | 模式 |
|---|---|---|---|
integrated_multimodal_description | 综合多模态描述 | integrated 把画面、动作、镜头、对白、声音等整合到同一时间线,融合成一个统一的、按时间线组织的多模态描述。 | |
overall_soundscape | 整体声景 | soundscape 直译是声景 ,常在声音设计、声学研究领域使用,表达的是整体声音环境 | |
non_diegetic_music | 非画面内音乐 | 接近非叙事空间音乐 / 非故事内音乐,本质是:角色听不到、只有观众能听到的配乐,“画外配乐”。 | |
subject_definitions | 主题定义 | 定义参考内容及其对应的参考标签 | Full Reference |
summary | 摘要 | 概括任务类型、目标视频及主要参考关系 | Full Reference |
retention_analysis | 保留分析 | 描述参考内容如何被保留、迁移或复用 | Full Reference |
detailed_description | 详细描述 | 按播放顺序详细描述画面、动作、镜头、声音和对白 | Full Reference |
其他
- 文本描述的主体语言使用英语;
- 对话、歌词、场景可见文字等保留原始语言;
- 关于:优先使用具体的视觉和音频细节进行描述,避免使用“cinematic(电影感)”或“beautiful(唯美)”等抽象词汇 的理解:
- cinematic、beautiful 这类词是评价或风格概括,但没有明确告诉模型应该生成哪些可观察、可听见的特征。
- 需要具体的视觉特征,比如:场景:夜晚、雨后街道、光线:霓虹灯、湿地反射、镜头:平视、缓慢向前跟拍、景深/主体关系:背景行人轻微虚化。
- 音频一样的道理,比如:音乐:轻柔钢琴 + 持续的低音弦乐、环境音:持续雨声、空间声音:远处汽车从左向右经过、动作声音:脚踩水洼的溅水声。
- 能够被直接“看到”或“听到”的具体特征。
- 如果去掉 cinematic / beautiful / dramatic / epic / immersive 这些形容词后,剩下的 Prompt 仍然能让人比较明确地想象出画面和声音,那它通常就足够具体。
- 不是禁止使用 cinematic、beautiful,而是:不要依赖这些抽象词承担主要描述工作。