
快速回答
MiniMax H3已上线Hilight。MiniMax于2026年7月31日发布H3,将它定位为开放、通用型多模态视频模型。H3可以在同一套生成上下文中理解文字、图片、视频和音频,重点强调768P与2K输出、4—15秒视频、原生立体声音频、更强指令遵循、更自然连贯的生成、文字与品牌信息呈现、V2V动作迁移和局部编辑。
现在,用户可以在Hilight素材工坊的文生视频、图生视频、空镜素材、虚拟试穿片段和商品特写五个功能中选择MiniMax H3。其中,文生视频和图生视频是视频快创里的两种生成模式,支持768P与2K输出,时长为4—15秒。
制作一条商业视频时,创作者经常需要在一句提示词里同时说明商品长什么样、人物怎么动、镜头怎么走、声音如何配合、包装文字必须保持什么状态。任何一个环节出现偏差,都可能让已经满意的画面失去使用价值。
MiniMax H3 的核心变化,是让文字、图片、视频和音频在模型层面共同参与视频生成。Hilight本期先开放文生视频、图生视频、空镜素材、虚拟试穿片段和商品特写五个创作功能,让电商和营销团队可以从提示词、商品图、服装图或场景图开始制作具体镜头。
MiniMax H3 是什么?
MiniMax 于2026年7月31日正式发布H3,并将它定义为开放、通用型多模态视频模型。在部分产品和社区内容中,它也会被称为 Hailuo H3 或 Hailuo 3.0;本文统一采用官方模型名称 MiniMax H3。
H3可以统一理解文字、图片、视频和音频上下文。根据 MiniMax H3官方视频生成文档,模型支持文生视频、首尾帧图生视频、参考素材生成和视频编辑。
这组能力尤其适合商业内容。商品视频不仅需要风格好看,还可能需要固定包装、保持人物身份、复现特定动作、控制运镜、保留品牌信息,并让声音和画面共同服务一条卖点。H3把更多创作要求提前带入生成环节,让模型不只负责“让画面动起来”。
MiniMax H3 核心规格
| 能力维度 | MiniMax官方规格 |
|---|---|
| 模型定位 | 开放、通用型多模态视频模型 |
| 输出清晰度 | 768P、2K |
| 输出时长 | 4—15秒 |
| 上下文输入 | 文字、图片、视频和音频 |
| 参考素材 | 官方API最多支持9张图片、3段视频和3段音频,混合输入最多12个文件 |
| 生成方式 | 文生视频、首尾帧图生视频、参考素材生成 |
| 视频编辑 | 模型层面支持局部编辑 |
| 音频 | MiniMax重点强调原生立体声音频 |
官方参考生成规则最多支持9张图片、3段视频和3段音频,混合输入总数最多12个文件。图生视频可使用单首帧、单末帧或首帧加末帧;在Hilight中,用户可以根据文生视频、图生视频、空镜素材、虚拟试穿片段和商品特写五个功能准备对应素材。
参数说明了模型的技术范围,但H3更值得关注的地方,是这些输入如何共同控制主体、动作、运镜、声音和后续修改。
MiniMax 官方重点强调的 H3 能力
1. 统一理解文字、图片、视频和音频
H3的核心不只是“可以上传多种文件”,而是让模型把它们理解为同一个创作方向的不同组成部分。
图片可以确定商品形状、材质、颜色、包装,或者固定人物身份;视频可以演示人物怎么移动、商品怎么被拿起、摄影机怎么穿过场景;音频可以定义人声、环境声、音效或节奏;提示词则负责说明这些素材应该如何配合,以及成片最终要表达什么。
例如制作一条宠物用品新品视频时,团队可以提供一张干净的包装图,用短视频参考克制的环绕运镜,用音频参考轻微户外环境声和犬项圈声,再通过提示词说明灯光、镜头顺序、目标受众和结尾商品展示。每份素材都有明确任务,不必把所有要求都塞进一段冗长描述。
2. 视频原生生成立体声音频
MiniMax把原生立体声音频作为H3的重要能力。声音不再只能等画面生成后再单独添加,而可以成为同一次视频生成中的组成部分。
对于商业内容,这可以用于表现包装打开的声音、服装场景中的脚步声、液体倒入杯中的音效、生活方式镜头的环境声,或者让音乐和效果音跟随商品亮相的节奏变化。
原生音频并不意味着发布前无需试听。对白、音效时机、音量、品牌调性和左右声道表现仍然值得确认。它带来的价值,是团队可以先得到一版更完整的音画方向,再决定哪些声音保留、替换或重新混合。
3. 更强指令遵循和更连贯的生成
MiniMax将“更自然、更连贯的生成与表达”作为H3的核心定位。这一点在提示词包含多个连续要求时尤其重要。
假设一条12秒商品视频需要先从瓶身水珠开始,接着出现手部互动,再进入真实使用场景,最后回到干净的商品主画面。模型不仅要完成每一个动作,还要理解先后顺序、保持商品身份、控制摄影机,并让几个镜头之间形成连续关系。
清晰的提示词结构仍然重要。主体、动作、环境、镜头、声音、时间和限制条件越明确,模型越容易理解预期。H3强调更强指令遵循,让创作者可以描述一段完整过程,而不必把视频缩减成一个孤立动作。
4. 用参考视频传递动作、运镜和节奏
文字可以说明“模特转身”“人物跳跃”或“镜头推进”,但很难准确表达动作有多快、从哪里开始、身体如何转移重心、摄影机何时跟随,以及镜头最后怎样停下来。
H3可以利用参考视频指导动作、运镜或剪辑节奏。这类能力适合服装展示、人物表演、商品互动、体育动作、游戏宣传片,以及那些仅靠形容词很难说清楚时机和路径的镜头。
参考视频不一定要制作精良,关键是让模型看清预期动作。尽量选择主体明确、动作无遮挡、构图清楚,而且时长接近目标输出的视频。
5. 更重视文字、包装和品牌信息呈现
MiniMax的H3能力展示重点提到文字和品牌信息呈现。模型的目标不只是生成带有文字或Logo的单帧画面,还要在主体动作与镜头运动过程中,更好地维持这些信息的外观和位置。
这属于MiniMax对H3的官方能力定位,并不代表所有生成结果中的文字都会完全准确。具体商品、字体、运动强度和镜头距离仍会影响表现,正式内容需要检查原尺寸结果。它对电商生产的进一步影响,将在下文单独展开。
6. 局部编辑,让迭代更集中
当一条视频已经接近目标时,一个错误物体、背景细节、人物表情或文字,不应该让其他满意的部分全部失去价值。MiniMax将视频编辑列为H3支持的能力,并强调更精准的局部修改。
局部编辑可以让迭代更集中:尽量保留已经合适的构图、主体、动作和节奏,再清楚说明需要调整的部分。它可以用于修改包装颜色、替换背景元素、改变服装、调整视觉效果,或者制作适合不同市场的内容版本。
这里的效率来自减少不必要的整条重做,而不是假设每次修改都能一步完成。更稳妥的方式,是一次只提出一个清晰变化,并将新结果与原视频中需要保留的内容逐项对照。
7. 面向广告、电商、品牌和游戏等商业内容
MiniMax将H3定位于广告、电商、品牌和游戏等商业内容工作流。参考控制、指令遵循、文字与品牌信息呈现、动作迁移和视频编辑,也直接对应商品展示、品牌短片、服装动态与游戏宣传片中常见的制作要求。
MiniMax H3 对营销视频生产意味着什么?
H3特别适合电商视频的关键,不只是能让商品动起来,而是更重视商品在运动中的文字、包装和品牌信息。普通创意视频只要画面自然、好看,可能就已经达到目的;但电商视频中的瓶型、包装颜色、Logo位置、标签和规格文字一旦发生变化,画面中的商品就不再是正在销售的那个SKU,即使镜头很漂亮也无法直接用于商品页或广告投放。
H3对品牌信息呈现的强化,让商品特写、包装亮相、开盒、拿取、试穿和使用场景更值得尝试,也让团队有机会在保持商品核心信息的基础上改变背景、人物、动作和开场,为同一SKU扩展多个创意版本。
正式发布前仍需用原尺寸结果检查包装、Logo和文字,不能把这项能力理解为绝对准确。它真正解决的,是AI电商视频从“看起来像商品广告”走向“能够代表这个具体商品”的关键问题。
在 Hilight 的五个功能中使用 MiniMax H3
Hilight在素材工坊中提供文生视频、图生视频、空镜素材、虚拟试穿片段和商品特写五种MiniMax H3创作功能。你可以先通过MiniMax H3 AI营销视频生成器了解模型能力与适用场景,再根据手中的素材和需要生成的镜头选择入口。| Hilight功能 | 什么时候使用 | 需要提供什么 | H3如何支持任务 |
|---|---|---|---|
| 文生视频 | 已经有场景或广告想法,但没有起始画面 | 结构清楚的提示词 | 生成768P或2K、4—15秒的商品、人物或场景镜头 |
| 图生视频 | 已经有商品图、人物图或场景图 | 提示词;可提供首帧、末帧或首尾帧 | 从指定画面开始或控制镜头起止状态 |
| 空镜素材 | 现有视频缺少开场、环境、商品氛围或转场 | 提示词与1张图片 | 补充场景、运镜和氛围镜头 |
| 虚拟试穿片段 | 需要把服装图变成动态穿搭展示 | 服装图、模特与风格方向 | 生成服装动态与人物展示片段 |
| 商品特写 | 需要突出材质、包装、标签或纹理 | 商品图和特写要求 | 生成近景运镜并突出商品细节 |
对于服装商品,可以继续查看 如何用一张服装图生成虚拟试穿视频,了解服装图准备、模特选择、展示方式和成片确认方法。
如果当前还没有明确的镜头方向,可以先从更上游的营销内容规划开始。Hilight智能成片可以整理商品信息、卖点、受众和活动要求,形成视频方向、脚本与分镜。商品链接生成视频指南介绍了如何从商品详情页出发,生成完整商品视频。智能成片负责组织整条视频,上述五个H3功能更适合生成具体镜头和素材。
发布H3视频前重点确认什么?
H3把更多创作信息带进生成环节,但商业内容仍然需要一轮集中确认。
- 商品身份:确认形状、比例、颜色、材质和关键细节。
- 品牌信息:放大查看Logo、标签、包装文字、结尾主画面和促销信息。
- 人物与动作:确认人脸、手部、服装、商品互动、身体平衡和运动过程。
- 提示词执行:确认成片是否采用了预期动作、运镜、风格和声音方向。
- 声音:分别用耳机和扬声器试听对白、音效、环境声、音乐平衡和异常噪声。
- 连续性:注意人物身份、商品形态、灯光、背景和空间关系是否突然变化。
- 渠道适配:确认画面比例、字幕安全区、节奏、时长和平台要求。
- 权利与披露:使用有权使用的参考素材,并遵守AI内容、商品声明、音乐、声音和人物肖像相关要求。
对于品牌内容,建议查看原尺寸文件,不要只依赖小尺寸预览。有些画面以正常速度播放时看起来很自然,但标签、文字或手部细节仍可能需要重新处理。
常见问题
H3更适合生成完整广告,还是单个视频镜头?
H3尤其适合生成目标明确的4—15秒镜头或短序列,例如商品亮相、服装动态展示、包装特写、环境空镜、转场和品牌场景。多个H3片段可以组成更长的营销视频。如果还需要Hilight统筹营销方向、视频脚本、分镜、配音、字幕和完整结构,可以先使用智能成片,再用支持H3的功能生成具体素材和镜头。
在Hilight中应该选择哪个H3功能?
先看手里有什么素材,再看当前缺什么镜头。只有场景想法,或需要首尾帧控制时,进入视频快创并选择对应生成模式;需要环境、开场或转场镜头时选空镜素材;服装动态展示选虚拟试穿片段;需要表现包装、材质、标签或纹理时选商品特写。
MiniMax H3可以使用哪些输入,应该怎么组合?
H3可以使用文字、图片、视频和音频。按照官方API参考生成规则,混合输入最多12个文件,不同格式还有各自限制。更好的组合方式是让每份素材只承担一个明确任务:图片负责主体和外观,视频负责动作或运镜,音频负责人声、环境或节奏,提示词负责时间线、构图、限制和信息表达。在Hilight中,根据所选五个创作功能准备页面要求的素材即可。
MiniMax H3可以生成多长、什么清晰度的视频?
Hilight中的MiniMax H3支持768P与2K输出,时长为4—15秒。文生视频支持21:9、16:9、4:3、1:1、3:4和9:16;图生视频的比例由输入图片决定。
MiniMax H3可以直接生成声音吗?
可以。MiniMax重点强调H3的原生立体声音频能力,视频结果可以在同一次生成中带有商品音效、环境声、人物动作声、音乐或音画节奏。用于正式内容时,建议分别用耳机和扬声器完整试听,再确认对白、音效时机、音乐平衡、异常噪声和品牌调性。
H3可以根据参考视频复现动作和运镜吗?
可以。H3可以用参考视频指导人物动作、摄影机运动或剪辑节奏。清楚的参考可以比长串动作形容词更直接地表达速度、时机和空间关系。更合理的预期是“用参考控制方向”,而不是要求逐帧复制。
H3生成的包装文字和Logo可靠吗?
MiniMax将文字和品牌信息呈现列为H3的重点能力,因此它更适合用于包装亮相、商品特写、品牌场景和结尾主画面。正式发布前仍应查看原尺寸结果。建议提供干净商品参考图,在提示词中明确哪些标签、Logo、颜色和比例不能改变,并逐段确认拼写和包装细节,不要只看最后一帧。
可以只修改H3视频的一个局部吗?
MiniMax将视频编辑列为H3支持的能力。局部编辑可用于调整指定物体、背景、表情、服装、特效或品牌细节,同时尽量保留已经满意的构图和动作。建议一次只修改一个明确问题,并说清哪些内容必须保留。
在Hilight使用MiniMax H3如何计费?
MiniMax H3按清晰度和生成时长计费:768P为20星光点/秒,2K为30星光点/秒。文生视频和图生视频采用相同规则,输入图片不单独扣费;生成失败或命中安全审核不扣费。设置清晰度与时长后,仍应以生成按钮显示的实际消耗为准。
MiniMax H3生成的视频可以用于商业内容吗?
MiniMax将H3定位于广告、电商、品牌、游戏等商业内容工作流。一条具体视频是否可以正式商用,还取决于Hilight当前套餐、模型政策、上传参考素材的使用权,以及发布平台规则。发布前应确认商品声明、音乐和声音权利、人物肖像授权、品牌信息,以及是否需要进行AI内容标识。
总结
MiniMax H3最值得关注的地方,是把多项商业视频控制能力放进同一个模型:统一理解文字、图片、视频和音频,原生生成立体声,更好地遵循复杂指令,让长动作和镜头关系更连贯,并进一步支持V2V动作参考、品牌信息呈现和局部编辑。
对电商和营销团队来说,可以先选择一个商品或主体、一条核心卖点和一个清楚的镜头,再用商品图或首尾帧固定视觉起点,通过提示词描述动作、运镜、声音和不能改变的品牌信息,最后进入Hilight中与任务匹配的工具。
如果希望了解另一款多模态视频模型,可以继续阅读 Seedance 2.5 已上线 Hilight。模型选择应根据镜头任务、参考素材、时长、控制方式和最终发布渠道决定。
