H3 提示词写作技巧

发布于 2026-09-10

基础知识

MiniMax H3 提示词基础知识,包括 T2VA、I2VA、FL2VA、L2VA 和 Full-Reference 任务模式、提示词字段结构以及多模态描述的基本写作原则。

任务模式

MiniMax H3 提供了两种模型变体,

  • H3-Base-FL2VA
  • H3-Base-Ref2VA

分别对应 Base Model 基础模式 和 Full-Reference Mode 全参考模式。

Base Model 共有 4 种模式:

使用如下字段:

  • integrated_multimodal_description,综合多模态描述;
  • overall_soundscape,整体声景;
  • non_diegetic_music,非画面内音乐;

T2VA

  • Text to Vide and Audio,即:文本 -> 视频 + 音频;
  • 从文本直接构建完整的视听时间线。

I2VA

  • Image to Vide and Audio,即:文本 + 图像 -> 视频 + 音频;
  • Image 承担首帧角色,从给定首帧开始向后生成。
  • 沿用成熟的 I2V(Image-to-Video) 概念,给一张图片作为起始画面,然后让视频从这张图片继续发展。
  • I2VA 的 I 描述的是输入模态(Image)。

FL2VA

  • First and Last frame to Video and Audio,即:首帧和末帧 -> 视频 + 音频。
  • 首帧和尾帧都给定,模型负责生成二者之间连续的视听过程。

L2VA

  • Last frame to Video and Audio,即:末帧 -> 视频 + 音频。
  • 给定尾帧,模型推断合理的起始场景,并生成逐步过渡至该尾帧的连续视听过程。
  • L2VA 的 L 描述的是输入图片在时间轴上的位置(Last)。

Full-Reference Mode

按照顺序使用的字段有:

  1. subject_definitions
  2. summary
  3. retention_analysis
  4. detailed_description
  5. overall_soundscape
  6. non_diegetic_music

字段说明

字段中文翻译说明模式
integrated_multimodal_description综合多模态描述integrated 把画面、动作、镜头、对白、声音等整合到同一时间线,融合成一个统一的、按时间线组织的多模态描述。
overall_soundscape整体声景soundscape 直译是声景 ,常在声音设计、声学研究领域使用,表达的是整体声音环境
non_diegetic_music非画面内音乐接近非叙事空间音乐 / 非故事内音乐,本质是:角色听不到、只有观众能听到的配乐,“画外配乐”。
subject_definitions主题定义定义参考内容及其对应的参考标签Full Reference
summary摘要概括任务类型、目标视频及主要参考关系Full Reference
retention_analysis保留分析描述参考内容如何被保留、迁移或复用Full Reference
detailed_description详细描述按播放顺序详细描述画面、动作、镜头、声音和对白Full Reference

其他

  • 文本描述的主体语言使用英语;
  • 对话、歌词、场景可见文字等保留原始语言;
  • 关于:优先使用具体的视觉和音频细节进行描述,避免使用“cinematic(电影感)”或“beautiful(唯美)”等抽象词汇 的理解:
    • cinematic、beautiful 这类词是评价或风格概括,但没有明确告诉模型应该生成哪些可观察、可听见的特征。
    • 需要具体的视觉特征,比如:场景:夜晚、雨后街道、光线:霓虹灯、湿地反射、镜头:平视、缓慢向前跟拍、景深/主体关系:背景行人轻微虚化。
    • 音频一样的道理,比如:音乐:轻柔钢琴 + 持续的低音弦乐、环境音:持续雨声、空间声音:远处汽车从左向右经过、动作声音:脚踩水洼的溅水声。
    • 能够被直接“看到”或“听到”的具体特征。
    • 如果去掉 cinematic / beautiful / dramatic / epic / immersive 这些形容词后,剩下的 Prompt 仍然能让人比较明确地想象出画面和声音,那它通常就足够具体。
    • 不是禁止使用 cinematic、beautiful,而是:不要依赖这些抽象词承担主要描述工作。