速度本身就是工作流能力
更快的一轮生成意味着可以先验证构图,再比较动作,随后只改一条指令并保留最合适的版本,而不是让每个草稿都变成长时间等待。
H3 Max 独立页面,与现有 MiniMax H3 工作区明确区分。
选择生成模式,添加必需素材,写下导演指令,然后生成 MiniMax H3 Max 视频。
MiniMax H3 Max 是 MiniMax H3 的后训练视频变体,重点改善提示词遵循、美学表现和画面与声音的快速迭代。
可以从镜头文字简报、首帧与可选尾帧,或图片、视频、音频参考素材开始。模型输出短视听片段,因此镜头、动作、对白、环境声和音乐可以写在同一份制作简报里。
更快的一轮生成意味着可以先验证构图,再比较动作,随后只改一条指令并保留最合适的版本,而不是让每个草稿都变成长时间等待。
H3 Max 使用 5–15 秒以及 480P、768P、1080P 输出;基础 MiniMax H3 仍是独立的 4–15 秒与 2K 工作流选择。
关键不是堆更多开关,而是让镜头简报、输入素材、画面和声音使用一组清晰且能协同工作的控制。
在一个提示词中描述主体、场景、动作顺序、镜头运动、光线、对白、环境声和排除项。六种画幅覆盖电影宽屏、标准、方形与竖屏交付。
以上传的首帧开场,并可补充尾帧。图片决定输出画布,提示词负责中间的动作、镜头与视听过渡。
时长可在 5 至 15 秒之间按整秒选择。短片适合单个视觉节拍,更长片段可容纳揭示、反应或连续动作。
480P 适合经济地验证构图,768P 平衡迭代与清晰度,选中的镜头需要更大交付画面时可使用 1080P 潜空间精修。
把对白、空间底噪、拟音、音乐和静默与画面一起写入提示词,让声音与视觉共同规划,而不是最后再拼接。
参考图片可定义主体和风格,视频可示范运动,音频可指导声场。在提示词中为每份素材明确职责,避免参考相互冲突。
创意开放时从文字开始,构图固定时从首尾帧开始,需要共同约束身份、动作与声音时使用多模态参考。

适合新概念、快速变体、镜头研究,以及需要由提示词同时定义画面与声音的场景。

适合产品静物、角色设定图、主视觉,以及必须从指定构图开始或结束的转场。

适合组合多份源素材,并要求每个输入在同一制作任务中承担明确职责的简报。
把提示词当成简短镜头单。先锁定真正重要的决定,删去无关信息,再对目标明确的变体进行比较。
开放创意用文字模式;需要固定开场或收束构图时用图生视频;多份媒体需要共同影响成片时用参考模式。
按观众看到的顺序写主体、场景、动作节拍、镜头、光线与声音,并让动作量与选择的时长相匹配。
选择 5–15 秒、适合的文生视频画幅或源图画布,并按草稿或交付需求确定分辨率。
分别检查指令遵循、身份、动作、构图和声音。只修改最弱的一条指令,不要把已经有效的简报全部重写。
两者属于 H3 家族,但实际接口边界不同。应根据交付所需的时长、分辨率和迭代方式选择工作区。
| 选择维度 | MiniMax H3 Max | MiniMax H3 | 实际含义 |
|---|---|---|---|
| 主要侧重 | 面向速度的后训练变体 | 开放权重基础模型 | 需要快速比较多个版本时选 Max;更看重基础 H3 工作流时保留原模型。 |
| 时长 | 5–15 秒 | EIMG 工作区为 4–15 秒 | 4 秒请求属于现有 H3 工作流,不属于 H3 Max。 |
| 分辨率 | 480P、768P 或 1080P | EIMG 工作区为 768P 或 2K | H3 Max 增加草稿档与 1080P,但不会继承 H3 的 2K 控件。 |
| 输入方式 | 文字、首尾帧或多模态参考 | 文字、首尾帧或多模态参考 | 入口形式熟悉,但可接受参数和定价合同仍必须按模型分别处理。 |
分辨率名称仅表示各自接口的输出选项,不能直接当作跨模型通用的质量保证。
好提示词需要说明画面里有什么、如何变化、镜头怎样观察,以及观众听见什么,而不是让一个短镜头承担整部影片。
指出必须保持可识别的人、物、产品或环境,只保留本镜头真正需要的外观特征。
使用清晰动词描述短序列,并把揭示、转身、碰撞、反应或变化按发生顺序排列。
说明景别、镜头感,以及与动作相配合的跟拍、摇移、推拉、环绕、手持或固定机位。
用时段、主光、颜色关系、天气、材质反应和空间层次固定环境。
需要对白时写准确台词,再补充语气、空间底噪、拟音、音乐或有意安排的静默。
用简短限制排除不需要的切镜、字幕、抖动、额外人物、Logo 变化或声音元素。
这个结构让画面与声音共享同一时间线,同时把短片集中在一个清晰变化上。
一个连续 8 秒的棚拍镜头。哑光黑便携音箱放在潮湿玄武岩上。以水珠极近景开始,镜头缓慢顺时针环绕,格栅亮起细窄的琥珀色脉冲。第 6 秒脉冲抵达 Logo,镜头最终停在干净的产品四分之三角度。硬质轮廓光,柔和反射补光,深炭灰背景,水珠真实。声音:低沉空间底噪,三次与灯光同步的电子滴答,最后出现短促温暖的低音。不要切镜,不要字幕,不要手,不要额外产品。
当团队需要在进入最终剪辑前比较多组有明确导演意图的短镜头时,这类模型尤其合适。
让主视觉、材质细节、包装打开或可控光线变化动起来,用于商品页与发布创意。
测试竖屏开头、不同运镜、动作节拍和声音提示,同时保持核心创意一致。
使用首帧或参考素材探索手势、反应、服装运动和短表演节拍。
在投入更长渲染或人工制作前,把关键画面或文字分镜转换为时间与动作参考。
协调色彩、画面文字要求、镜头节奏、环境声和音乐,探索紧凑的视觉识别方向。
原型化场景转场、环境动态、技能揭示、加载片段与风格化过场。
直接说明模型身份、生成方式、时长、分辨率、声音、提示词,以及它与基础 H3 的区别。
