
驅動一顆鏡頭的三種方式
純提示詞創作用文字生影片,讓首幀動起來用圖生影片,更有野心的需求用參考生影片:單次請求最多 9 張圖、3 段影片、3 條音軌,在提示詞裡以 "Image 1"、"Video 1"、"Audio 1" 引用。可以替換影片裡的人物、保留照片裡的臉,或用一段配音驅動台詞。
MiniMax H3 一次請求就能同時吃圖片、影片片段和音軌——在提示詞裡按順序指代它們,寫成 Image 1、Video 1、Audio 1。
MiniMax H3 是 MiniMax 裝在自家 Hailuo 3 產品裡的那個影片模型,2026 年 8 月 12 日接進來。一個選擇器後面掛著三個端點——文生影片、圖生影片和參考生影片——共用同一個面板和同一個每秒單價。參考模式是值得花點時間學的那部分:一次請求最多九張圖、三段影片和三條音軌,在提示詞裡按順序指代,而不是用 @ 標籤。
接下來是要花你錢的部分。參考影片是計費的:它的輸入秒數會加到你的輸出秒數上,所以一段 10 秒的參考配一條 10 秒的片子,按二十秒計費。圖生影片只用首幀——上游 API 提供的尾幀輸入,這裡沒有開。沒有 1080p,也沒有 4K,音訊沒有關閉開關,送出去的任務不能取消,而且這個模型我們沒有計過時。
MiniMax 的旗艦影片模型可生成內建原生音訊的 4–15 秒影片,768p 或 2K,可由文字、首幀圖驅動,也可以混合圖像、影片、音訊參考——不用 API key,也不用另開帳號。

純提示詞創作用文字生影片,讓首幀動起來用圖生影片,更有野心的需求用參考生影片:單次請求最多 9 張圖、3 段影片、3 條音軌,在提示詞裡以 "Image 1"、"Video 1"、"Audio 1" 引用。可以替換影片裡的人物、保留照片裡的臉,或用一段配音驅動台詞。

H3 輸出的影片內建原生音訊,在參考模式下還能對嘴演繹你提供的配音——給它一張人像和一段音訊,再描述表演方式即可。參考音訊免費,只有影片參考才會計入付費的輸入秒數。

兩檔輸出、按秒計價、生成前可見:768p 每秒 55 積分,2K 每秒 90 積分。4 秒的 768p 草稿是 220 積分;動態效果滿意後,用同一份需求以 2K 重跑出交付版。畫面比例六種,從 9:16 直式到 21:9 超寬幅。

H3 支援最長 7,000 字元的提示詞,足以一次寫清鏡頭運動、走位、服裝和氛圍。每次生成都會把完整提示詞和參數存入歷史紀錄——這週跑出的好鏡頭,下週照樣能重現。
2026 年 8 月 15 日在這裡生成,一次出片,提示詞與參數原樣展示。每段影片對應本頁下方所主張的某一項能力。
A thunderstorm rolling over a wheat field at dusk, wind bending the crop in waves, distant lightning illuminating the clouds, low rumbling thunder, slow push-in.
A street musician playing an upright bass on a rainy night pavement, fingers moving on the strings, reflected neon in the puddles, handheld documentary camera.
它是這批模型裡參考素材吃得最多的一個:單次請求能接的輸入素材比 Veo 各檔或 Kling 都多,片長也越過了八秒這堵牆。
一次請求九張圖、三段影片、三條音軌,在提示詞裡按順序指代。這足夠在一次生成裡同時保住一張照片裡的臉、另一張裡的場景,和一段錄音裡的聲音。
Veo 兩個檔位都停在八秒。H3 能跑到十五秒,任意整秒,統一的每秒費率——所以片長是個直截了當的決定,而不是在方案之間跳。
在參考模式下,它會把你提供的語音演出來,口型同步,而參考音訊本身不收費。在提示詞裡描述念白的方式,就像你給演員說戲一樣。
兩個檔位,各一個統一費率,同一條提示詞。先用便宜的檔把運動跑通,然後用完全相同的指令在 2K 重跑一遍,作為交出去的版本。
音訊沒有關閉開關,檔位到 2K 為止,任務一旦送出就會跑完。需要無聲片,Kling 3.0 預設不開聲音;需要 4K,Veo 兩個檔位和 Kling 3.0 都有這一檔。
同一個工作區,同一個點數池——在這幾個之間切換只要點一下。
| MiniMax H3 | Veo 3.1 Pro | Veo 3.1 Fast | Kling 3.0 | |
|---|---|---|---|---|
| 解析度 | 768p · 2K | 720p · 1080p · 4K | 720p · 1080p · 4K | 720p · 1080p · 4K |
| 片長 | 4–15 秒,任意整秒 | 4、6 或 8s | 4、6 或 8s | 3–15 秒,任意整秒 |
| 聲音 | 原生自帶,始終開啟——沒有開關 | 可選,而且會改變費率 | 可選,而且會改變費率 | 可選開關,預設關閉 |
| 每秒點數,768p 和 2K | 768p 55 · 2K 90 | 沒有這一檔——這個檔位跑的是 720p、1080p 和 4K | 沒有這一檔——這個檔位跑的是 720p、1080p 和 4K | 沒有這一檔——這個模型跑的是 720p、1080p 和 4K |
| 每秒點數,720p | 沒有這一檔 | 無聲 80 · 帶音訊 160 | 無聲 50 · 帶音訊 75 | 無聲 45 · 帶聲音 60 |
| 每秒點數,1080p | 沒有這一檔 | 無聲 80 · 帶音訊 160——和 720p 同一費率 | 無聲 50 · 帶音訊 75——和 720p 同一費率 | 無聲 60 · 帶聲音 85 |
| 每秒點數,4K | 沒有這一檔 | 無聲 160 · 帶音訊 240 | 無聲 150 · 帶音訊 175 | 200,含聲音,不額外收費 |
| 單條片子的點數,從最低到最高 | 只算輸出為 220–1,350;加上 15 秒參考影片和 9 張參考圖為 2,820 | 320–1,920 | 200–1,400 | 135–3,000 |
| 單次請求的參考素材 | 最多 9 張圖、3 段影片和 3 條音軌,共 12 個 | 一張圖 | 一張圖 | 一張圖 |
| 我們自己測的速度 | 5 秒影片耗時 3m 33s,20 秒影片耗時 7m 32s,兩者皆為 720p(共 2 段影片,2026 年 8 月) | 未實測 | 未實測 | 未實測 |
本表中的解析度、片長和每一個點數數字,都是 2026 年 8 月 20 日從我們自己的模型註冊表讀出來的——就是給你的生成計價的那套每秒費率表,不是廠商的行銷頁。費率按輸出秒數計,所以要乘上你選的片長;在 H3 上,參考影片的輸入秒數按同一費率加進這個秒數裡。解析度的行之所以拆開,是因為 H3 提供 768p 和 2K,而另外三個提供 720p、1080p 和 4K——某個模型不賣的檔位標成「沒有這一檔」,而不是拿個相近的數字填上。我們沒測過的格子會直說。
把 MiniMax H3 和其他影片模型放在同一個工作區比較,一鍵即可切換。
| 模型 | minimax-h3(MiniMax H3,Hailuo 3 背後的模型)——2026 年 8 月 12 日接進這裡 |
|---|---|
| 模式 | 文生影片、從首幀出發的圖生影片,以及基於混合素材集的參考生影片——一個選擇器後面三個端點,價格相同 |
| 解析度 | 768p 和 2K——沒有 1080p 檔,也沒有 4K 檔 |
| 時長 | 4 到 15 秒,任意整秒(預設 4 秒) |
| 長寬比 | 文生和參考模式下支援 16:9、9:16、1:1、4:3、3:4 和 21:9;圖生影片跟隨參考幀 |
| 參考素材 | 最多 9 張圖、3 段影片和 3 條音軌,共 12 個。參考影片每段 2–15 秒,合計 15 秒。在提示詞裡以「Image 1」、「Video 1」、「Audio 1」指代 |
| 提示詞長度 | 最多 7,000 個字元 |
| 音訊 | 原生自帶,始終開啟——沒有音訊開關 |
| 點數 | 按秒計:768p 55,2K 90,三種模式同一費率。參考影片的輸入秒數按同樣的每秒費率計費;第五張之後的參考圖每張加 30;參考音訊免費 |
| 單條片子的點數區間 | 4 秒 768p 的片子 220,15 秒 2K 的片子 1,350。塞滿 15 秒參考影片和 9 張參考圖後,一個 2K 請求最高到 2,820 |
| 取消 | 任務送出後無法取消 |
| 實測速度 | 沒測過——這個模型我們沒跑過計時基準測試 |
從空白的提示詞欄位到一支成片,只要三個步驟。
打開模型選擇器,選擇 MiniMax H3。在你花掉任何點數之前,面板就會顯示它的點數費用、解析度選項與時長上限。
寫清楚主體、動作,以及鏡頭怎麼運鏡。想讓影片從某張圖開始,就附上首影格。
下載成片、延長它,或送去進一步編輯。提示詞、模型與設定都會一併保存在你的歷史紀錄裡。
一個帳號,完整的圖像與影片生成工作流程。
用免費方案的每日點數執行 MiniMax H3,或升級以取得進階模型、更快的生成與 4K 輸出。
年繳 · $240/year
擅長電影感的角色演出與多模態參考創作——讓首幀動起來、保留參考照片中的人物身分、按提供的音訊對嘴演繹。輸出為 768p 或 2K 的 4–15 秒影片,內建原生音訊。
輸出每秒 768p 收 55 積分、2K 收 90 積分,一段 4 秒的 768p 影片即 220 積分。參考影片的輸入秒數按相同費率計費;參考圖超過 5 張後每張加收 30 積分;參考音訊免費。準確的總價會在生成前顯示。
是的——H3 就是 MiniMax 在其 Hailuo 影片產品中使用的模型。在 CreateVision AI 上,你不需要 MiniMax 帳號或 API key,直接在瀏覽器裡就能執行。
最多 9 張圖、3 段影片(每段 2–15 秒,合計不超過 15 秒)和 3 條音軌,總計不超過 12 個素材。在提示詞裡按順序引用:"Image 1"、"Video 1"、"Audio 1"。
4 到 15 的整數秒,768p 或 2K。文字模式和參考模式支援 16:9、21:9、4:3、1:1、3:4 和 9:16(參考模式還能自動調整);圖生影片則跟隨首幀圖的比例。
不能。H3 每次生成都會產出原生音訊,而且沒有開關,所以你看到的費率就是唯一的費率。要無聲素材,你可以在剪輯裡靜音,或者換一個聲音可選的模型——Kling 3.0 預設就不開。
拍 4–15 秒的角色與對白鏡頭,H3 的 CP 值更高。Seedance 2.5 能拍到 30 秒、單次可用的參考素材也多得多,但每秒單價較貴。要便宜的草稿,Seedance 2.0 Mini 仍是預算首選。
生成前後的工作都有一鍵工具——修飾、換風格、直接分享。