2026 年 7 月 31 日,MiniMax 正式发布 MiniMax H3。这款模型在 Arena 的图生视频、视频编辑两个榜单中均排名第一,并在 Artificial Analysis 的视频编辑榜单中再次登顶。相比单纯从文字生成画面,H3 更强调原生音画同步,以及对图像、视频和音频等多模态素材的协同处理。同时,33B 基础模型 H3-Base 的权重也已于 8 月 3 日对外开放。
一、我的一次生成实测:东方天庭夜景
下面这段视频是我使用 MiniMax H3 生成的,时长约 15 秒、分辨率为 2560×1440。整个过程只输入下面的提示词并生成一次,没有经过剪辑、局部重绘或二次修改。
这次实测的优点主要在场景氛围和细节表现:夜色、云海、宫殿灯光和人物背影保持了较完整的东方仙境观感,整体画面有比较强的电影感。
其中,蜻蜓的细节表现尤其突出。它飞过长廊时,翅膀的形态、光泽和运动轨迹都比较自然,成为画面中很容易被注意到的细节。
局限主要在文字呈现:牌匾和建筑上的文字容易出现变形或不可辨识的笔画。这是当前视频生成模型普遍面临的问题,因此这个案例更适合用来观察 H3 的场景构建、镜头氛围和细节生成能力,而不是作为文字准确性的展示。
本次视频使用的提示词
纯正中国古代天庭,不包含任何西方幻想元素。
夜晚的东方天界,浩瀚星空下,一座无边无际的中国神话天宫矗立于九天云海之上。远处是层层叠叠的仙宫楼阁,全部采用中国唐宋宫殿建筑风格,朱红宫墙、琉璃瓦屋顶、飞檐翘角、斗拱结构、雕刻精美的白玉石柱、汉白玉台阶和长桥。
巨大的天庭长廊横贯云海,长廊两侧排列着中国古代宫灯,散发温暖柔和的光芒。云雾从玉阶之间缓缓流动,远处宫殿隐藏在月光和星辰之中,呈现中国神话中“天上宫阙”的感觉。
画面中央,一个身穿白色淡蓝色仙衣的中国女仙独自站在长廊之上,只留下一个远处的背影。她的衣裙随夜风飘动,长发垂落,身影在巨大的天宫面前显得渺小而孤独。
一只中国蜻蜓在月光中飞过长廊,翅膀映照星光,成为寂静天庭中唯一的生命。
电影级真实摄影风格,不要动漫,不要游戏风,不要西方城堡,不要欧洲建筑。真实中国古建筑质感,东方仙侠电影,美术级场景设计,真实光影,IMAX电影远景,宏大、宁静、孤独、唯美。
按照以上的提示词生成视频。
二、按任务看两份评测榜单:H3 强在哪里
Arena 采用真人盲测投票,更接近用户对成片效果的主观判断;Artificial Analysis 则以标准化评测为主,并设置了含音频图生视频、含音频文生视频等榜单。两者的分数和名次不能直接横比,但放在同一任务下看,能更清楚地判断 H3 到底强在哪里。
视频编辑:两份榜单都给出第一

Arena 的视频编辑榜上,H3 以 1390 分排名第一,比并列第二的 Dreamina Seedance 2.0 与 Gemini Omni Flash(均为 1358 分)高出 32 分,是它在 Arena 三条子榜中领先幅度最大的一项。

Artificial Analysis 的视频编辑榜也将 H3 排在第一:1126 分,比 Gemini Omni Flash(1123 分)高 3 分。视频编辑难在既要保留人物、构图与画面细节,又要完成精确改动;两份评测在这一点上给出了同样的结论,说明编辑控制是 H3 最明确的优势。
图生视频:Arena 榜单第一,Artificial Analysis 含音频榜单第二

Arena 图生视频榜上,H3 以 1489 分排名第一,领先 Dreamina Seedance 2.0 720p(1479)和 Gemini Omni Flash(1462)。图生视频考验的是"参考图 + 指令"的组合控制力,H3 的表现与其多素材融合定位相符。

Artificial Analysis 的含音频图生视频榜单还会同时考察声音与画面。H3 以 1193 分排第二,仅落后 Dreamina Seedance 2.0 720p(1198)5 分,仍高于 Gemini Omni Flash(1192)。这不是与 Arena 完全相同的榜单,但能补充说明:在加入音频要求后,它依然处于最前列。
文生视频:纯文本与原生音画的表现差异

在 Arena 的纯文生视频榜上,H3 排第 5(1453 分),落后 Gemini Omni Flash(1512)、flux-3-video(1496)、Dreamina Seedance 2.0 720p(1478)和 muse-video(1457)。这提示它并非每个赛道都占优:纯靠一句文字从零生成画面,不是它最突出的场景。

但在 Artificial Analysis 的含音频文生视频榜单中,H3 以 1238 分排名第二,仅落后 Gemini Omni Flash(1241)3 分。两个结果的差异也恰好勾勒出它的能力边界:给到图像、视频或音频等参考素材,并要求音画同步、精确控制时,H3 更能发挥优势。
MiniMax 已开放33B 基础模型权重(H3-Base),采用 Community License;开发者和企业用户需要根据许可证确认适用地域、商业规模、分发和下游使用要求。
三、减少多环节拼接,实现原生音画同频
过去的 AI 视频创作,常常需要经历多道工序:
| 传统 AI 视频流程 | MiniMax H3 模式 |
|---|---|
| 先生成画面 ➔ 再找 AI 配音 ➔ 挂软件凑口型 ➔ 超分补帧 | 在同一序列中协同生成多种模态内容 |
| 画面与音频分离,时序与内容容易脱节 | 让画面、动作、台词与音效在统一多模态流程中协同处理 |
| 环节越多,细节崩坏概率越高 | 多模态协同生成,减少传输与拼接损耗 |
H3-Base 核心模型将声音、画面与动作纳入同一多模态序列处理。面对"用 A 图的角色长相,演 B 视频的动作,配 C 音频的声音"这类复合指令,它可以在同一序列中完成理解与音视频生成;完整的 H3 工作流还包括负责上下文处理和 2K 重生成的其他模块。
四、12 份素材"锁定控制",解决角色一致性痛点
做 AI 视频时,角色和素材的一致性是重要考量。MiniMax H3 的参考模式允许一次性输入最多 12 个文件:单类输入上限分别为 9 张图片、3 段视频和 3 段音频;混合输入时,所有文件合计最多 12 个:
- 图片:锁定五官、发型与服装细节;
- 视频:锁定特定的镜头运镜与肢体动效;
- 音频:精准指定音色与语气情绪。
这种多维度的参考控制,为需要保持角色、动作和声音一致性的创作提供了更多操作空间。
五、自然语言指令精修,文字与品牌信息呈现
MiniMax H3 支持用自然语言描述编辑目标,让系统根据指令处理参考素材:
- 局部替换:"把主角手里的咖啡杯换成透明玻璃杯";
- 元素擦除:"把背景里的路人擦除";
- 精准文字渲染:官方展示了文字与品牌信息呈现能力,适合在广告、电商等场景中进一步测试。
总结
MiniMax H3 在视频编辑上获得了 Arena 与 Artificial Analysis 的双重第一;图生视频和含音频生成的表现也较为突出。结合其原生音画同步与多素材控制能力,它更适合对参考素材、编辑精度和成片音画协同有要求的创作场景。H3-Base 权重已在 Community License 下开放,开发者使用前应先确认许可证的地域、商业和分发要求。