
驱动一个镜头的三种方式
纯提示词创作用文生视频,让首帧动起来用图生视频,野心更大的需求用参考生视频:单次请求最多 9 张图、3 段视频、3 条音轨,在提示词里按 "Image 1"、"Video 1"、"Audio 1" 引用。可以替换视频里的人物、保留照片里的脸,或用一段配音驱动台词。
MiniMax H3 一次请求就能同时吃图片、视频片段和音轨——在提示词里按顺序指代它们,写成 Image 1、Video 1、Audio 1。
MiniMax H3 是 MiniMax 装在自家 Hailuo 3 产品里的那个视频模型,2026 年 8 月 12 日接进来。一个选择器后面挂着三个接口——文生视频、图生视频和参考生视频——共用同一个面板和同一个每秒单价。参考模式是值得花点时间学的那部分:一次请求最多九张图、三段视频和三条音轨,在提示词里按顺序指代,而不是用 @ 标签。
接下来是要花你钱的部分。参考视频是计费的:它的输入秒数会加到你的输出秒数上,所以一段 10 秒的参考配一条 10 秒的片子,按二十秒计费。图生视频只用首帧——上游 API 提供的尾帧输入,这里没有开。没有 1080p,也没有 4K,音频没有关闭开关,提交出去的任务不能取消,而且这个模型我们没有计过时。
MiniMax 的旗舰视频模型可生成自带原生音频的 4–15 秒视频,768p 或 2K,可由文字、首帧图驱动,也可以混合图像、视频、音频参考——无需 API key,无需另开账号。

纯提示词创作用文生视频,让首帧动起来用图生视频,野心更大的需求用参考生视频:单次请求最多 9 张图、3 段视频、3 条音轨,在提示词里按 "Image 1"、"Video 1"、"Audio 1" 引用。可以替换视频里的人物、保留照片里的脸,或用一段配音驱动台词。

H3 输出的视频自带原生音频,在参考模式下还能口型同步地演绎你提供的配音——给它一张人像和一段音频,再描述表演方式即可。参考音频免费,只有视频参考才会计入付费的输入秒数。

两档输出、按秒计价、生成前可见:768p 每秒 55 积分,2K 每秒 90 积分。4 秒的 768p 草稿是 220 积分;运动效果满意后,用同一份需求以 2K 重跑出交付版。画面比例六种,从 9:16 竖屏到 21:9 超宽幅。

H3 支持最长 7,000 字符的提示词,足以一次写清镜头运动、走位、服装和氛围。每次生成都会把完整提示词和参数存入历史记录——这周跑通的镜头,下周照样能复现。
2026 年 8 月 15 日在这里生成,一次出片,提示词与参数原样展示。每段片子对应本页下方所主张的某一项能力。
A thunderstorm rolling over a wheat field at dusk, wind bending the crop in waves, distant lightning illuminating the clouds, low rumbling thunder, slow push-in.
A street musician playing an upright bass on a rainy night pavement, fingers moving on the strings, reflected neon in the puddles, handheld documentary camera.
它是这批模型里参考素材吃得最多的一个:单次请求能接的输入素材比 Veo 各档或 Kling 都多,片长也越过了八秒这堵墙。
一次请求九张图、三段视频、三条音轨,在提示词里按顺序指代。这足够在一次生成里同时保住一张照片里的脸、另一张里的场景,和一段录音里的声音。
Veo 两个档位都停在八秒。H3 能跑到十五秒,任意整秒,统一的每秒费率——所以片长是个直截了当的决定,而不是在套餐之间跳。
在参考模式下,它会把你提供的语音演出来,口型同步,而参考音频本身不收费。在提示词里描述念白的方式,就像你给演员说戏一样。
两个档位,各一个统一费率,同一条提示词。先用便宜的档把运动跑通,然后用完全相同的指令在 2K 重跑一遍,作为交出去的版本。
音频没有关闭开关,档位到 2K 为止,任务一旦提交就会跑完。需要无声片,Kling 3.0 默认不开声音;需要 4K,Veo 两个档位和 Kling 3.0 都有这一档。
同一个工作区,同一个积分池——在这几个之间切换只要点一下。
| MiniMax H3 | Veo 3.1 Pro | Veo 3.1 Fast | Kling 3.0 | |
|---|---|---|---|---|
| 分辨率 | 768p · 2K | 720p · 1080p · 4K | 720p · 1080p · 4K | 720p · 1080p · 4K |
| 片段时长 | 4–15 秒,任意整秒 | 4、6 或 8 秒 | 4、6 或 8 秒 | 3–15 秒,任意整秒 |
| 声音 | 原生自带,始终开启——没有开关 | 可选,而且会改变费率 | 可选,而且会改变费率 | 可选开关,默认关闭 |
| 每秒积分,768p 和 2K | 768p 55 · 2K 90 | 没有这一档——这个档位跑的是 720p、1080p 和 4K | 没有这一档——这个档位跑的是 720p、1080p 和 4K | 没有这一档——这个模型跑的是 720p、1080p 和 4K |
| 每秒积分,720p | 没有这一档 | 无声 80 · 带音频 160 | 无声 50 · 带音频 75 | 无声 45 · 带声音 60 |
| 每秒积分,1080p | 没有这一档 | 无声 80 · 带音频 160——和 720p 同一费率 | 无声 50 · 带音频 75——和 720p 同一费率 | 无声 60 · 带声音 85 |
| 每秒积分,4K | 没有这一档 | 无声 160 · 带音频 240 | 无声 150 · 带音频 175 | 200,含声音,不额外收费 |
| 单条片子的积分,从最低到最高 | 只算输出为 220–1,350;加上 15 秒参考视频和 9 张参考图为 2,820 | 320–1,920 | 200–1,400 | 135–3,000 |
| 单次请求的参考素材 | 最多 9 张图、3 段视频和 3 条音轨,共 12 个 | 一张图 | 一张图 | 一张图 |
| 我们自己测的速度 | 5 秒用了 3m 33s,20 秒用了 7m 32s,均为 720p(2 个片段,2026 年 8 月) | 未实测 | 未实测 | 未实测 |
本表中的分辨率、片长和每一个积分数字,都是 2026 年 8 月 20 日从我们自己的模型注册表读出来的——就是给你的生成计价的那套每秒费率表,不是厂商的营销页。费率按输出秒数计,所以要乘上你选的片长;在 H3 上,参考视频的输入秒数按同一费率加进这个秒数里。分辨率的行之所以拆开,是因为 H3 提供 768p 和 2K,而另外三个提供 720p、1080p 和 4K——某个模型不卖的档位标成“没有这一档”,而不是拿个相近的数字填上。我们没测过的格子会直说。
把 MiniMax H3 和其他视频模型放在同一个工作台里对比,一键即可切换。
| 模型 | minimax-h3(MiniMax H3,Hailuo 3 背后的模型)——2026 年 8 月 12 日接入这里 |
|---|---|
| 模式 | 文生视频、从首帧出发的图生视频,以及基于混合素材集的参考图生视频——一个选择器后面三个端点,价格相同 |
| 分辨率 | 768p 和 2K——没有 1080p 档,也没有 4K 档 |
| 时长 | 4 到 15 秒,任意整秒(默认 4 秒) |
| 宽高比 | 文生和参考模式下支持 16:9、9:16、1:1、4:3、3:4 和 21:9;图生视频跟随参考帧 |
| 参考素材 | 最多 9 张图、3 段视频和 3 条音轨,共 12 个。参考视频每段 2–15 秒,合计 15 秒。在提示词里以“Image 1”、“Video 1”、“Audio 1”指代 |
| 提示词长度 | 最多 7,000 字符 |
| 音频 | 原生自带,始终开启——没有音频开关 |
| 积分 | 按秒计:768p 55,2K 90,三种模式同一费率。参考视频的输入秒数按同样的每秒费率计费;第五张之后的参考图每张加 30;参考音频免费 |
| 单条片子的积分区间 | 4 秒 768p 的片子 220,15 秒 2K 的片子 1,350。塞满 15 秒参考视频和 9 张参考图后,一个 2K 请求最高到 2,820 |
| 取消 | 任务提交后无法取消 |
| 实测速度 | 我们没测过——这个模型我们没跑过计时基准测试 |
从空白提示词框到一段成片,只要三步。
打开模型选择器,选择 MiniMax H3。在你花掉任何积分之前,面板就会显示它的积分费用、分辨率选项与时长上限。
写清主体、动作,以及镜头怎么运动。想让片子从某张图开始,就附上首帧。
下载成片、延长它,或送去进一步编辑。提示词、模型与设置都会一同保存在你的历史记录里。
一个账户,打通图像与视频生成全流程。
用免费额度的每日积分运行 MiniMax H3,或升级以获得高级模型、更快生成与 4K 输出。
按年计费 · $240/year
擅长电影感的角色表演和多模态参考创作——让首帧动起来、保持参考照片中的人物身份、按提供的音频口型同步地演绎。输出为 768p 或 2K 的 4–15 秒视频,自带原生音频。
输出每秒 768p 收 55 积分、2K 收 90 积分,一段 4 秒的 768p 视频即 220 积分。参考视频的输入秒数按相同费率计费;参考图超过 5 张后每张加收 30 积分;参考音频免费。准确的总价会在生成前显示。
是的——H3 就是 MiniMax 在其 Hailuo 视频产品中使用的模型。在 CreateVision AI 上,你无需 MiniMax 账号或 API key,直接在浏览器里就能运行。
最多 9 张图、3 段视频(每段 2–15 秒,合计不超过 15 秒)和 3 条音轨,总计不超过 12 个素材。在提示词里按顺序引用:"Image 1"、"Video 1"、"Audio 1"。
4 到 15 的整数秒,768p 或 2K。文字模式和参考模式支持 16:9、21:9、4:3、1:1、3:4 和 9:16(参考模式还能自动适配);图生视频则跟随首帧图的比例。
不能。H3 每次生成都会产出原生音频,而且没有开关,所以你看到的费率就是唯一的费率。要无声底片,你可以在剪辑里静音,或者换一个声音可选的模型——Kling 3.0 默认就不开。
拍 4–15 秒的角色和对白镜头,H3 的性价比更高。Seedance 2.5 能拍到 30 秒、单次可用的参考素材也多得多,但每秒单价更贵。要便宜的草稿,Seedance 2.0 Mini 仍是预算之选。
生成前后的活儿都有一键工具——修饰、换风格、直接分享。