OmniHuman 1.5 AI 會說話虛擬人生成器

給 OmniHuman 1.5 一張人像和一段人聲,它還你一段這個人一字不差說出你那段話的影片——口型、表情和手勢都跟著聲音走。

0 / 2,000
130 cr/s · ≤35s

什麼是 OmniHuman 1.5?

OmniHuman 1.5 是 ByteDance 的音訊驅動虛擬人模型:給它一張人像和一段人聲,它還你一段這個人說這段音訊的影片——口型、表情、頭部動作和手勢全部由聲音驅動。和提示詞驅動的影片模型不同,說哪些字由你來給。論文裡把一個多模態語言模型和一個擴散 Transformer 接在一起,所以表演會對說的內容做出反應,而不只是跟著嘴動。

話說在前面:它需要正面人像。下面那條四分之三側臉的測試裡,嘴幾乎沒張開,頭還越偏越遠。每次生成的音訊上限 35 秒,稿子更長就得切開分段再拼接;多人對話——論文裡的招牌功能——這裡沒有。它做的是說話影片,不是場景影片:要鏡頭運動或動作,用 Seedance 2.5 或 Kling 3.0 Turbo。

架構、定位與使用者研究數據來自字節跳動研究論文: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

測試者怎麼說

1.5 版在高難度輸入上表現出更強的穩健性。
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
一張手和肩膀清晰可見、光線自然的半身人像,通常能帶來更好的身體動作。
Z.Tools — OmniHuman-1.5 deep dive
濃重的陰影、墨鏡、奇怪的遮擋和過小的臉,都會增加難度。
Z.Tools — OmniHuman-1.5 deep dive

為什麼在 CreateVision AI 上使用 OmniHuman 1.5?

模型是字節跳動的;在這裡用它的理由,是另外兩樣輸入——臉和聲音——都出自同一個工作台。

用作 OmniHuman 1.5 虛擬人短片輸入人臉的 GPT Image 2 人像

整條輸入鏈都在同一頁上

一條虛擬人短片需要三樣東西:一張臉、一段聲音、一個模型。在這裡三樣都出自同一個工作台——用 GPT Image 2 或 Seedream 生成人像,輸入腳本並用 60 個內建音色之一合成語音,再把兩者直接餵給 OmniHuman 1.5。本頁每條短片都是這樣端到端做出來的:沒有錄過一秒音訊,也沒有上傳過任何真人照片。

普通話茶館案例的輸入人像

一個音色庫,替代一間錄音室

文字模式不是附贈品:60 個音色涵蓋英語、中文、日語、韓語、法語、德語、西班牙語、義大利語、俄語和葡萄牙語,每個都能先試聽再花錢。輸入最多 600 個字元,選一個音色,平台就會合成語音並在同一次執行裡驅動虛擬形象。上面的普通話茶館短片走的正是這條路——全程沒碰麥克風。

新聞主播案例的輸入人像

一份訂閱,成本提前可見

OmniHuman 1.5 按音訊秒數計費——每秒 130 點數、向上取整——工作台會在你按下生成前顯示這條短片的確切成本。同一方案還涵蓋 GPT Image 2、Nano Banana Pro、Seedream、Seedance、Kling 和 Veo,所以合理的工作流程很省:先花幾枚點數打磨人像、敲定腳本,最後才把點數花在虛擬人秒數上。記得剪掉音訊裡的靜音——每一秒你都在付費。

用於 OmniHuman 1.5 壓力測試的四分之三側臉輸入人像

實測為準,不打包票——連失敗也一起展示

我們的七條實測短片生成於 2026 年 8 月 19 日——帶貨口播、新聞快訊、健身房動員、普通話茶館歡迎詞、繪本角色、一條故意做砸的四分之三側臉,以及一條寬幅舞台鏡頭。每個被接受的任務都一次成片,約 10 秒音訊耗時 3 分 20 秒到 4 分 42 秒。我們也公開出問題的部分:那個週二晚尖峰,上游用容量報錯拒絕了我們 20 次提交中的 13 次才接單(被拒絕的執行自動退款),有一個任務排隊 14 分鐘,而本頁的側臉短片正展示了無視「正面人像」建議的確切下場。

本工作台實測的 OmniHuman 1.5 短片

以下 7 條短片全部於 2026 年 8 月 19 日在本站生成——每條都是這組輸入的第一次成片,沒有重拍、沒有挑片。人像是 GPT Image 2 的產出;每個聲音都由輸入文字經內建音色庫合成。被接受的任務約 10 秒音訊耗時 3 分 20 秒到 4 分 42 秒回傳(有一條排隊 14 分鐘);當晚尖峰時段上游曾以容量不足報錯拒絕了數次提交才接單——被拒絕的執行會退款。請開聲音。

提示詞9.2 秒音訊 · Trustworthy Man 音色 · 1,300 點數 · 4 分 42 秒

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

提示詞10.2 秒音訊 · News Anchor 音色 · 1,430 點數 · 4 分 09 秒

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

提示詞10.7 秒音訊 · Energetic Guy 音色 · 1,430 點數 · 4 分 00 秒

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

提示詞11.8 秒音訊 · 普通話 Sweet Girl 音色 · 1,560 點數 · 4 分 19 秒

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

提示詞9.7 秒音訊 · Sweet Girl 音色 · 1,300 點數 · 4 分 01 秒

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

提示詞8.6 秒音訊 · Wise Lady 音色 · 1,170 點數 · 這個角度下口型同步明顯退化

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

提示詞5.4 秒音訊 · Movie Narrator 音色 · 780 點數 · 本頁底圖正是這條影片的一幀

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5 到底適合誰

以下每一條都對應上方演示過的短片——不是願望清單。

  • 課程作者與講解者

    輸入旁白文字,螢幕上就有了主講人——不用相機、燈光或重拍。每條 35 秒的上限恰好對應一條講一個概念,而這本來就是多數課程剪輯的切法。

  • UGC 與產品行銷人員

    上面的音箱帶貨案例就是完整工作流程:生成一張手持你產品的創作者風格人像,輸入賣點文案,選個音色。沒有出鏡費,也不用去追肖像授權——這張臉從未存在過。

  • 在地化團隊

    同一張臉可以用十種語言傳達同一條訊息:人像不變,換音色即可。口型同步跟隨你提供的任何音訊——上面的普通話案例就是證明。

  • 無真人出鏡頻道與虛擬主持人

    你生成的人設就是你擁有的人設。設計一次臉,配上固定的庫內音色,它就能主持每一集節目——上面的繪本角色案例說明它甚至不必是照片級寫實。

  • Podcast 與音訊優先的創作者

    最難的部分你已經有了:音訊。剪一段 35 秒以內的精華,配上一張人像,不用打開剪輯軟體就得到一條社群平台可用的影像短片。

OmniHuman 1.5 對比 Seedance 2.5、Veo 3.1 Pro 與 Kling 3.0 Turbo

口播影片與場景影片——每個模型需要你提供什麼,又在這個工作台裡交回什麼。

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
你需要提供什麼1 張人像照片 + 你的音訊,或輸入文字並選一個庫內音色一段提示詞,可選圖像、影片和音訊參考一段提示詞,可選參考圖一段提示詞或一張起始圖
誰在說這些話你——虛擬形象對你的音軌逐字對口型模型根據提示詞生成配音模型根據提示詞生成配音音訊隨短片一起生成
此處的片長等於你的音訊長度,最長 35 秒4–30 秒4–8 秒3–15 秒
點數每秒音訊 130 點數480p 每秒 110 · 720p 每秒 230每條 320–1,920(4–8 秒 · 720p–4K · 含/不含音訊)720p 每秒 55 · 1080p 每秒 70
本站實測約 10 秒音訊約需 4 分鐘(7 條實測,2026 年 8 月)未在此任務上實測未在此任務上實測未在此任務上實測

點數、時長與輸入選項讀取自本工作台自己的模型註冊表(2026 年 8 月 19 日)——描述的是你在這裡能得到什麼,而不是廠商公布的規格。耗時是我們對上方短片的實測;同樣的腳本我們沒有在另外三個模型上跑過,所以那些格子如實寫明,而不是去猜。

更多類似 OmniHuman 1.5 的影片模型

將 OmniHuman 1.5 與其他視訊模型進行比較-相同的工作區,一鍵切換。

OmniHuman 1.5 在 CreateVision AI 上的規格

模型omnihuman-1.5,字節跳動出品(研究論文發表於 2025 年 8 月)
模式會說話的虛擬人:一張照片 + 一條音軌 → 口播影片,就在本頁的虛擬人工作台
輸入恰好 1 張人像,外加最長 35 秒的音訊(上傳 mp3/wav)——或輸入最多 600 字元的文字合成語音
音色庫60 個內建音色涵蓋 10 種語言:英語、中文、日語、韓語、法語、德語、西班牙語、義大利語、俄語、葡萄牙語
可選引導一句簡短的表演提示,描述動作、情緒和鏡頭——有用,但從不是必填
輸出一個保持你照片構圖的連續鏡頭;片長等於音訊長度。實測輸出:2:3 照片得 1248×1664,16:9 得 1920×1088,25 fps,H.264 影片 + 單聲道 AAC 音訊
點數每秒音訊 130 點數、向上取整——最低 130,滿 35 秒為 4,550;生成前會顯示確切成本
實測速度7 條實測中,被接受的任務約 10 秒音訊耗時 3 分 20 秒–4 分 42 秒;有一條排隊 14 分鐘(2026 年 8 月,一個繁忙的週二晚上)

如何把一張照片變成會說話的虛擬形象

開始生成影片
  1. 放入人臉

    上傳一張清晰、正面、半身的人像——或者就在這個工作台用 GPT Image 2 或 Seedream 生成一張,本頁所有人臉都是這麼來的。一張照片一個人;讓臉大而無遮擋。

  2. 給它一個聲音

    上傳一段音訊(mp3 或 wav,最長 35 秒),或切換到文字模式:輸入最多 600 個字元,從 10 種語言的 60 個音色中挑一個,每個都能先試聽。

  3. (可選)指導表演

    一句「平靜、輕微點頭、淺淺微笑」這樣的短提示就能引導手勢和情緒。留空的話,模型會自己讀取音訊的節奏與含義。

  4. 生成並檢查口型

    執行前會顯示確切的點數成本——它隨音訊長度變化。生成是非同步的;短片會連同全部輸入一起進入歷史記錄,可用的設定下週還能原樣重現。

OmniHuman 1.5 之外

一個帳號,完整的圖像與影片生成工作流程。

相關閱讀

OmniHuman 1.5 價格與每日免費點數

用免費方案的每日點數執行 OmniHuman 1.5,或升級以取得進階模型、更快的生成與 4K 輸出。

免費版

$0

入門的最佳選擇

  • 200 歡迎積分,每日最多使用 80
  • Z Image Turbo 以 0 點數草稿創作
  • 標準生成速度
  • 內含生成歷史紀錄
開始使用

Premium

最受歡迎
$29/month

年繳 · $240/year

  • 每月 8,000 積分,無每日限額
  • 所有進階模型——GPT Image 2、Nano Banana、Seedream、Seedance、Veo、Kling
  • 5 倍生成速度,優先排程
  • AI 提示詞優化
升級到 Premium

Ultimate

$49/month

年繳 · $380/year

  • 每月 18,000 積分,無每日限額
  • 高達 4K 解析度的 HD 生成
  • 優先支援
  • 最快的排程與新模型搶先體驗
升級到 Ultimate

OmniHuman 1.5 — 常見問題

1

什麼是 OmniHuman 1.5?

字節跳動的音訊驅動虛擬人模型。它接受一張人像照片和一條音軌,回傳這個人說出這段音訊的影片——嘴唇、表情、頭部動作和手勢都跟隨聲音。背後的研究論文發表於 2025 年 8 月。

2

虛擬形象能一字不差地說我的話嗎?

能——這正是它和提示詞驅動影片模型的區別。你提供音軌:上傳 mp3/wav,或輸入腳本並選擇內建音色,虛擬形象會逐字對口型。提示詞驅動的模型自己生成配音,很少能一字不差地說出你寫的話。

3

OmniHuman 1.5 免費嗎?

不免費——按音訊每秒 130 點數、向上取整計費,一條 10 秒短片就是 1,300 點數。生成前會顯示確切成本,失敗的執行會自動退款。腳本寫緊湊、剪掉靜音:音訊的每一秒都是你要付費的一秒。

4

好的素材照片該具備哪些條件?

正面、半身、單人,臉要大、光要勻、無遮擋——評測者和我們自己的測試結論一致。上面那條故意做的四分之三側臉測試展示了反例的下場:嘴唇幾乎不動,模型還把頭慢慢轉得更遠,桌上憑空多出了照片裡沒有的東西。生成的人像和相機拍的照片效果完全一樣好。

5

插畫或動漫角色也能用嗎?

可以——上面的繪本測試就是一張純 2D 插畫,OmniHuman 1.5 在保住畫風的前提下把它演活了:眼睛、眉毛和嘴都像手繪動畫角色一樣動。我們觀察到一個小怪癖:嘴張大時,模型給這張扁平插畫畫出了意外寫實的牙齒。字節跳動的論文還宣稱支援非人類主體;我們只測過這個插畫角色。

6

一條短片能多長?生成要多久?

本平台每條最多 35 秒音訊——更長的腳本需要切分再拼接。在我們 2026 年 8 月的測試裡,被接受的任務約 10 秒音訊耗時 3 分 20 秒到 4 分 42 秒回傳。同一晚的一個提醒:高負載時上游會先用容量報錯拒絕幾次提交才接單。被拒絕的執行不花錢,但尖峰時段請把重試時間算進去,不要卡著五分鐘後的死線。

7

OmniHuman 1.5 不擅長什麼?

首先是非正面的臉:我們的四分之三側臉測試裡嘴唇幾乎不動,頭還越轉越遠,桌上多出了照片裡沒有的東西。身分細節也可能在片中漂移——那條測試裡耳環換了形狀,另外兩條裡唇色比輸入略深。多人對話在這裡不可用,輸出解析度不高(我們的人像實測為 1248×1664,沒有 4K),而且它只做口播影片:要動作、運鏡或場景變化,請用 Seedance 2.5 或 Kling 3.0 Turbo。

8

影片可以商用嗎——以及我能用誰的臉?

你生成的影片可以在個人和商業專案中使用,須遵守我們的服務條款。臉才是要認真對待的部分:未經同意驅動真人照片可能侵犯肖像權與公開權,多個司法轄區現在還要求揭露合成主持人。生成的臉——比如本頁的每一張——完全繞開了授權問題。

讓一張照片開口說話

開始生成影片

價格與使用方式 · 關鍵事實OmniHuman 1.5

模型
OmniHuman 1.5
開發方
ByteDance
使用方式
在 CreateVision AI 工作台內透過 API 直接執行——登入即可生成。無需 API 金鑰,無需雲端專案,無需安裝軟體。
每次生成價格
每段 5 秒影片 650 點數起 ≈ $2.36(按 Premium 方案計算:$29/月,含 8,000 點數)。 免費方案每天包含 80 點數。
隱私
預設私密——任何方案下,其他用戶都無法看到你的生成內容。我們不會出售或濫用會員資料。 隱私權政策

最近更新OmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.