Nano Banana Video
MiniMax 全模态旗舰模型

MiniMax H3 — 全模态 AI 视频生成器,原生 2K 立体声

把文字、图片、视频片段和音频一起交给 MiniMax H3,一次生成最高 2K、自带立体声的成片。最长 15 秒,一遍成片,无需拼接。

视频生成器

从文字和图片创建带原生音频的精彩AI视频

添加
上传媒体
上传图片或视频作为参考
0/5000
效果展示

一个上下文,画面与声音同步生成

从单条提示词到参考驱动的品牌短片,看看 MiniMax H3 一遍能生成什么。

对白场景,唇形同步立体声
参考图驱动的 2K 产品广告
参考视频的动作迁移
MINIMAX H3

什么是 MiniMax H3?

MiniMax H3(又名海螺 3.0)是 MiniMax 于 2026 年 7 月发布的旗舰全模态视频生成模型,已开放权重。

MiniMax H3 将文字、图片、视频和音频作为一个统一上下文来理解,一次生成最高 2K 分辨率、最长 15 秒、自带原生立体声的视频。不用再为画面、配音、音效分别串工具——你像给动画师讲需求一样下指令:这张图锁定角色,这段视频定动作,这条音频定声音。

全模态统一上下文

大多数模型只做一件事——文生视频或图生视频。MiniMax H3 把所有输入视为同一个问题:理解多模态上下文,然后从中生成。一次请求最多可携带 9 张图片、3 段视频和 3 条音频。

为商业创作而生

从广告电商到 UI 动效和游戏 CG,MiniMax H3 渲染的画面文字和 Logo 在运动中依然清晰,角色跨镜头保持一致,还可以直接描述修改意见来修订成片。

为什么选择 MiniMax H3?

创作者和团队转向 MiniMax H3 做 AI 视频的六个理由。

声音与画面同步生成

对白、拟音、环境声和配乐与画面在同一遍生成,32 kHz 立体声。唇形精准同步,因为模型同时创造了画面和声音——无需配音、无需对轨、无需第三方工具。

原生 2K,不是放大

MiniMax H3 先生成 768P,再用原始上下文在模型内部重生成为 2K——是模型在精修自己的作品,而不是外挂的超分猜测。

全模态参考控制

用照片锁角色形象,用视频片段锁动作,用音频锁音色——单次请求最多 12 个参考文件,用自然语言为每个参考指定用途。

对话式修改,不用重摇

指出问题,说出想要的效果即可。换一件衣服、调整一场光、改一句台词——没提到的部分保持不变。

画面文字可直接交付

屏幕文字、品牌 Logo、包装和 UI 元素在运动中保持清晰——这正是 MiniMax H3 出现在广告、电商和产品设计工作流中的原因。

定价适合快速迭代

当一次试错成本低到像一杯咖啡,你就不会再死磕第一个想法。低成本渲染十个方向,留下最好的那个——这就是现代创意团队的工作方式。

如何使用 MiniMax H3

四步从提示词到 2K 成片。

1

选择起点

纯文字、首尾帧、或一堆参考素材——照片定形象、视频定动作、音频定声音。三种模式,控制力各不相同。

2

像写分镜一样写提示词

「一个女人在走路」给不了模型任何信息。「手持跟拍,深夜湿漉的停车场,钠灯灯光,脚步声和远处车流」才是五个可执行的决策。写清主体、变化、镜头、光线和声音。

3

设定画面

选比例、选 768P 或 2K、定 4–15 秒的时长。先测 5 秒版本,满意后再投入更长的渲染。

4

给修改意见,而不是重头再来

开着声音看一遍。哪里不对,用一句话描述修改点再跑一次——一次只改一个变量。满意后下载最高 2K 的成片。

小贴士:在提示词结尾写明配乐方向(或「不要音乐」)——留空的话 MiniMax H3 会自动创作一段配乐。

MiniMax H3 核心功能

一个模型装下可控、商用级 AI 视频所需的一切。

全模态统一上下文

文字、图片、视频、音频在同一个上下文中被统一理解——用自然语言为每个参考指定任务,MiniMax H3 自己理清它们的关系。

原生立体声

对白、拟音、环境声和配乐与画面同步生成,32 kHz 立体声,支持 11 种语言的口型同步对白。

最高 2K,4–15 秒

24 fps 原生 2K 输出,时长 4 到 15 秒按整秒调节——足够讲完一个完整节拍,又短到可以快速迭代。

精准的文字与 Logo 渲染

屏幕文字、品牌标识和包装在运动中保持清晰。提示词越精确,越多细节能活到最终成片。

动作迁移与首尾帧

把参考视频里的动作复制到新角色上,或者设定首帧和尾帧,让 MiniMax H3 自动演绎中间的过程。

全比例支持

21:9、16:9、4:3、1:1、3:4 和 9:16——从电影、社交流到竖屏短视频全覆盖,另有自适应模式服务图片驱动创作。

谁在使用 MiniMax H3?

从独立创作者到制作团队——所有看重可控性的工作流都适合。

内容创作者与博主

为 TikTok、Reels 和 YouTube Shorts 生成刷屏竖屏视频——音效设计和唇形同步开箱即得。

营销团队与广告公司

低成本渲染十个创意方向,而不是昂贵地做一个再被否。以制作成本的零头每天测试几十个广告概念。

导演与分镜师

MiniMax H3 懂真正的镜头语言——推轨、跟拍、变焦——用电影语言下指令即可,无需翻译成提示词黑话。预览可视化首选。

电商团队

把已经拍好的商品图变成动起来。用参考图锁定产品的形状、材质和 Logo,生成精致的产品短片。

游戏与应用工作室

角色 reel、UI 动效演示、CG 概念和过场预览——单次请求内角色跨镜头保持一致。

教育工作者与出版方

制作讲解视频、知识科普和课程素材,旁白与环境声自动匹配——不需要麦克风、录音棚和剪辑时间线。

创作者如何评价 MiniMax H3

早期用户谈它给工作流带来的改变。

原生音频才是真正的杀手锏。我在一条提示词里把镜头、对白和房间底噪都交代清楚,交回来的就是成片。我的交付周期从几天缩短到一小时左右。

M

Marcus Chen

独立导演

我们现在每周测试几十个产品概念。参考锁定让包装标签在每一条里都保持清晰——试过的其他工具没一个能把我们的 Logo 渲染不糊的。

S

Sofia Ramirez

DTC 品牌创意总监

动作迁移彻底说服了我。我用手机拍了一段舞蹈,和角色设定图一起喂进去,返回的是一段形象一致的动作表演。这在以前是个绑定工程师的活。

Y

Yuki Tanaka

动效设计师

MiniMax H3 常见问题

关于用 MiniMax H3 生成 AI 视频的一切。