Wan 3.0 AI 影片生成器

在瀏覽器中執行阿里巴巴旗艦模型 Wan 3.0:最長 30 秒的影片已附帶聲音,首尾幀模式可精確鎖定鏡頭的起點與終點,參考模式可在單次請求中讀取圖片、影片與音訊。

0 / 2,000
~400 cr

什麼是 Wan 3.0?

Wan 3.0 是阿里巴巴的通義萬相 3.0,是 Wan 2.7 的後繼版本,在此透過我們的影片供應商以 alibaba/wan-3.0 端點提供服務。三種模式共用同一個面板:僅憑提示詞的文字轉影片、可固定首幀並選擇性固定末幀的圖片轉影片,以及在單次請求中讀取最多 10 張圖片、5 段影片剪輯和 5 條音訊軌道的參考轉影片,每項素材在提示詞中以編號引用。它的關鍵數字在於範圍:2 到 30 之間的任意整秒、從 480p 草稿級到 1080p 的三種解析度,以及每段剪輯都會生成的音訊。

權衡之處非常具體。1080p 是上限——若需要 4K 交付成果,請使用 Kling 3.0。上游 API 定義了一種智慧時長模式,會自行決定片段長度;它會以 30 秒的上限預扣點數,因此我們沒有接上這個功能——在此你必須自行選擇明確的長度。參考影片的秒數會計入計費,價格預覽會在你確認前顯示這一點。本頁下方那兩段影片在此生成分別花了 3m 33s(5 秒,720p)和 7m 32s(20 秒,720p)——長鏡頭的生成時間請以分鐘而非秒來規劃。

阿里巴巴的通義萬相 3.0 可生成最長 30 秒、附原生音訊的剪輯,精確固定鏡頭的首幀與末幀,並在單次參考請求中同時讀取圖片、影片剪輯與音訊軌道 — 按秒計費,從 480p 預算級起步。

在此工作區生成的真實 20 秒連續 Wan 3.0 鏡頭的其中一幀

單次拍攝最長 30 秒

大多數 AI 影片模型止步於 10 或 15 秒;Wan 3.0 在單次連續生成中可達 30 秒。這個長度足以完成一支完整的產品導覽、一段有對白的場景,或一組無需事後拼接的連續鏡頭。可選 2 到 30 之間的任意整秒 — 按秒計費,因此 6 秒的草稿和 30 秒的成品價格完全成比例。

首尾幀影片插補範例

首尾幀控制

這裡的圖片轉影片不只是讓一張照片動起來:上傳首幀,並選擇性上傳末幀,Wan 3.0 會在兩個固定端點之間插補動態。它是本頁下方比較表中唯一接受末幀的模型 — 這就是「從這張圖開始」和「精確地從這張圖到那張圖」之間的差別。

驅動 AI 影片生成的多模態參考素材

單次參考請求:圖片、影片與音訊一起

參考轉影片在單次請求中接受混合素材 — 最多 10 張圖片、5 段短影片剪輯和 5 條音訊軌道 — 提示詞以編號引用每一項:「Image 1 的角色,像 Video 1 那樣移動,配樂像 Audio 1」。參考圖片和音訊免費;參考影片秒數會加進計費時長,費用會在生成前顯示。

在此工作區生成的真實 Wan 3.0 影片(含原生大提琴音訊)的其中一幀

原生音訊與 480p 預算級

音訊 — 人聲、音效、環境音 — 隨剪輯一起生成,關掉它的費用相同,因此聲音永遠不會有附加費。三種解析度的計費成整齊比例:480p 每秒 40 點,適合草稿,720p 為 80,1080p 為 160,適合成品。用 480p 迭代、用 1080p 完成,讓 30 秒的製作保持在可負擔的範圍內。

來自此工作區的真實 Wan 3.0 影片

於 2026 年 8 月 26 日在此生成,首次嘗試,完整顯示實際使用的提示詞與設定。這段 20 秒的影片是為了證明上述長鏡頭的說法——一次生成,無剪接、無拼接。

提示詞720p · 16:9 · 20s · 以 7m 32s 生成

One continuous handheld shot following a food vendor through a night market: she ladles broth at her stall, hands a bowl to a customer, wipes the counter, then looks up smiling as lanterns sway overhead, ambient market chatter and sizzling sounds throughout, no cuts.

提示詞720p · 16:9 · 5s · 以 3m 33s 生成

A cellist practicing alone in a sunlit rehearsal room, bow moving across the strings, warm resonant cello notes filling the space, dust motes in the light, slow push-in.

Wan 3.0 適合誰

它是這一組中的長篇與精確模型:30 秒上限、唯一的末幀控制,以及最廣的參考工具箱。

  • 故事放不進 10 秒的人

    產品導覽、有對白的場景和多節拍序列可在單次生成中達到 30 秒 — 不需拼接,剪輯之間沒有連貫性接縫,音訊軌道貫穿整個拍攝。

  • 必須精確從某處開始、在某處結束的鏡頭

    首末幀模式接受兩張圖片,並在兩者之間補插動作——一次轉變、一次揭露、一次必須精準落在特定構圖上的運鏡。本頁沒有其他模型接受末幀。

  • 用素材、而不只是文字來導演的創作者

    把某張圖片裡的角色、某段影片的動作風格和一段音樂餵給它,並在提示詞中以編號分別指稱。十張圖片、五段影片和五段音訊可以共同塑造一次生成。

  • 低成本打草稿,乾淨收尾

    480p 級距的計費是 1080p 費率的四分之一,提示詞行為完全相同,因此你可以用 1,200 點數反覆修改一段 30 秒的剪輯,確認到位後才用 4,800 點數渲染最終版本。

  • 不適合:4K 最終成片,或不想手動設定片段長度的人

    1080p 就是上限——4K 交付物屬於 Kling 3.0 的領域。而且上游的智慧時長模式沒有接進這裡,所以你每次都必須明確選擇 2 到 30 秒之間的長度。

Wan 3.0 與最接近它的影片模型對比

同一個工作區,同一個點數池——在這幾個之間切換只要點一下。

Wan 3.0Wan 2.7MiniMax H3Kling 3.0
解析度480p · 720p · 1080p720p · 1080p768p · 2K720p · 1080p · 4K
片長2–30 秒,任意整秒2–15 秒,任意整秒4–15 秒,任意整秒3–15 秒,任意整秒
計費方式按輸出秒數計費;參考影片秒數另計按輸出秒數計費按輸出秒數計費;參考影片秒數另計按輸出秒數計費
聲音原生支援,預設開啟——開與關費用相同原生自帶,始終開啟,沒有開關原生自帶,始終開啟,沒有開關可選開關,預設關閉
每秒點數,經濟級距480p 時 40不提供——720p 是下限768p 時 55720p 時 45,無聲音
每秒點數,1080p16070不提供——其最高級距是 2K、90無聲 60 · 帶聲音 85
6 秒 1080p 片子的點數9604201080p 不提供無聲 360 · 帶聲音 510
單條片子的點數,從最低到最高80–4,80080–1,050220–2,820135–3,000
圖生影片首幀+可選末幀僅首幀僅首幀僅首幀
參考素材最多 10 張圖片+5 段影片+5 段音訊,以 Image 1 / Video 1 / Audio 1 指稱最多 5 張圖片,以 Image 1、Image 2 … 指稱最多 9 張圖片+3 段影片+3 段音訊沒有——那唯一一張圖就是首幀
長寬比5 — 16:9, 9:16, 1:1, 4:3, 3:45 — 16:9, 9:16, 1:1, 4:3, 3:46 種——從 16:9 到 21:93 — 16:9, 9:16, 1:1
我們自己測的速度5 秒影片耗時 3m 33s,20 秒影片耗時 7m 32s,兩者皆為 720p(共 2 段影片,2026 年 8 月)未實測未實測未實測

本表中每一項解析度、片段長度與點數數字,都是在 2026 年 8 月 26 日從我們自己的模型登錄檔與程式碼中的費率表讀取而來——也就是實際為你的生成計費的同一份表,而非廠商的行銷頁面。四款模型全都按秒計費,因此單段影片的費用就是費率乘以你選擇的長度;Wan 3.0 與 MiniMax H3 另外還會將參考影片的秒數計入計費。速度數字只有我們自行生成並計時的那兩段 Wan 3.0 影片;其餘每個欄位都標示為「未測量」,而非借用別人的數字。

更多類似 Wan 3.0 的影片模型

將 Wan 3.0 與其他影片模型比較 — 同一個工作區,一鍵切換。

CreateVision AI 上的 Wan 3.0 規格

模型wan-3.0(通義萬相 3.0),由阿里巴巴開發 — 透過 alibaba/wan-3.0 端點提供服務
模式文字轉影片、具備首尾幀控制的圖像轉影片,以及可混合圖像、影片與音訊素材的參考轉影片
解析度480p、720p 與 1080p — 依 1x / 2x / 4x 比例計費
時長2–30 秒,可任選整秒(預設為 5)— 本平台上最長的範圍
長寬比16:9、9:16、1:1、4:3 與 3:4 適用於文字轉影片與參考轉影片;圖像轉影片則依循首幀
參考素材最多 10 張圖像、5 段影片(合計 15 秒)與 5 條音訊,在提示詞中以 Image 1、Video 1、Audio 1 引用
首幀 / 末幀圖像轉影片接受一個嚴格的首幀與一個可選的末幀;幀與參考素材在上游互斥
聲音原生 — 語音、音效與環境音隨影片一併生成;開啟或關閉聲音費用相同
點數以輸出秒數計:480p 為 40、720p 為 80、1080p 為 160 — 三種模式費率相同
參考影片計費參考影片的秒數會計入計費時長;參考圖像與音訊免費
單條片子的點數區間一段 2 秒 480p 影片為 80,一段 30 秒 1080p 影片最高為 4,800(另加任何參考影片秒數)
取消生成失敗將自動退費
實測速度一段 5 秒的 720p 影片耗時 3m 33s,一段 20 秒的 720p 影片耗時 7m 32s(共 2 段影片,2026 年 8 月 26 日)

如何使用 Wan 3.0

從空白的提示詞欄位到一支成片,只要三個步驟。

開始生成影片
  1. 選擇 Wan 3.0

    開啟模型選擇器並選擇 Wan 3.0。在您花費任何點數之前,面板會顯示其點數費用、解析度選項與時長限制。

  2. 描述你想要的畫面

    寫清楚主體、動作,以及鏡頭怎麼運鏡。想讓影片從某張圖開始,就附上首影格。

  3. 生成之後,繼續做下去

    下載成片、延長它,或送去進一步編輯。提示詞、模型與設定都會一併保存在你的歷史紀錄裡。

Wan 3.0 之外

一個帳號,完整的圖像與影片生成工作流程。

Wan 3.0 定價與免費每日點數

使用免費方案的每日點數執行 Wan 3.0,或升級以取得進階模型、更快的生成速度與 4K 輸出。

免費版

$0

入門的最佳選擇

  • 200 歡迎積分,每日最多使用 80
  • Z Image Turbo 以 0 點數草稿創作
  • 標準生成速度
  • 內含生成歷史紀錄
開始使用

Premium

最受歡迎
$29/month

年繳 · $240/year

  • 每月 8,000 積分,無每日限額
  • 所有進階模型——GPT Image 2、Nano Banana、Seedream、Seedance、Veo、Kling
  • 5 倍生成速度,優先排程
  • AI 提示詞優化
升級到 Premium

Ultimate

$49/month

年繳 · $380/year

  • 每月 18,000 積分,無每日限額
  • 高達 4K 解析度的 HD 生成
  • 優先支援
  • 最快的排程與新模型搶先體驗
升級到 Ultimate

Wan 3.0 — 常見問題

1

Wan 3.0 最擅長什麼?

長鏡頭與可控拍攝:最長 30 秒且具原生音訊的影片、可精確鎖定鏡頭起點與終點的首尾幀模式,以及能在單一請求中同時讀取圖像、影片與音訊的參考模式。

2

Wan 3.0 在 CreateVision AI 上如何計費?

以輸出秒數計:480p 為 40 點、720p 為 80 點、1080p 為 160 點 — 文字轉影片、圖像轉影片與參考轉影片費率相同。參考影片的秒數會計入計費時長;參考圖像與音訊免費。確切費用會在生成前顯示,執行失敗將自動退費。

3

Wan 3.0 支援哪些模式?

僅憑提示詞的文字轉影片、以首幀為基礎的圖像轉影片(可選末幀),以及最多 10 張圖像、5 段影片與 5 條音訊的參考轉影片,在提示詞中以 Image 1、Video 1、Audio 1 引用。

4

Wan 3.0 影片可以有多長?

2 到 30 秒,任意整秒——這是本平台所有影片模型中最長的範圍。每種長度的影片都會一併生成聲音。

5

Wan 3.0 與 Wan 2.7 相比如何?

Wan 3.0 將長度上限翻倍(30s 對比 15s),新增 480p 經濟級別與末幀控制,並將參考素材從 5 張圖片擴展為混合的圖片+影片+音訊素材。Wan 2.7 在 720p 下仍是較低費率的選擇(每秒 40 對比 80 點數),適合較短的多鏡頭作品。

6

若生成失敗會怎麼樣?

影片生成失敗時點數會自動退還——您只需為成功完成的片段付費。

用 Wan 3.0 執導你的第一個 30 秒鏡頭

開始生成影片

探索我們的一鍵 AI 影片工具

生成前後的工作都有一鍵工具——修飾、換風格、直接分享。

價格與使用方式 · 關鍵事實Wan 3.0

模型
Wan 3.0
開發方
Alibaba
使用方式
在 CreateVision AI 工作台內透過 API 直接執行——登入即可生成。無需 API 金鑰,無需雲端專案,無需安裝軟體。
每次生成價格
每段 5 秒影片 200 點數起 ≈ $0.73(按 Premium 方案計算:$29/月,含 8,000 點數)。 免費方案每天包含 80 點數。
隱私
預設私密——任何方案下,其他用戶都無法看到你的生成內容。我們不會出售或濫用會員資料。 隱私權政策

最近更新Wan 3.0

  1. New

    Wan 3.0 (Alibaba Tongyi Wanxiang 3.0) integrated — clips up to 30 seconds with native audio, first-and-last-frame control, and reference-to-video that reads up to 10 images, 5 video clips and 5 audio tracks in one request. 480p/720p/1080p at 40/80/160 credits per second.