
整條輸入鏈都在同一頁上
一條虛擬人短片需要三樣東西:一張臉、一段聲音、一個模型。在這裡三樣都出自同一個工作台——用 GPT Image 2 或 Seedream 生成人像,輸入腳本並用 60 個內建音色之一合成語音,再把兩者直接餵給 OmniHuman 1.5。本頁每條短片都是這樣端到端做出來的:沒有錄過一秒音訊,也沒有上傳過任何真人照片。
給 OmniHuman 1.5 一張人像和一段人聲,它還你一段這個人一字不差說出你那段話的影片——口型、表情和手勢都跟著聲音走。
OmniHuman 1.5 是 ByteDance 的音訊驅動虛擬人模型:給它一張人像和一段人聲,它還你一段這個人說這段音訊的影片——口型、表情、頭部動作和手勢全部由聲音驅動。和提示詞驅動的影片模型不同,說哪些字由你來給。論文裡把一個多模態語言模型和一個擴散 Transformer 接在一起,所以表演會對說的內容做出反應,而不只是跟著嘴動。
話說在前面:它需要正面人像。下面那條四分之三側臉的測試裡,嘴幾乎沒張開,頭還越偏越遠。每次生成的音訊上限 35 秒,稿子更長就得切開分段再拼接;多人對話——論文裡的招牌功能——這裡沒有。它做的是說話影片,不是場景影片:要鏡頭運動或動作,用 Seedance 2.5 或 Kling 3.0 Turbo。
架構、定位與使用者研究數據來自字節跳動研究論文: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)
“1.5 版在高難度輸入上表現出更強的穩健性。”
“一張手和肩膀清晰可見、光線自然的半身人像,通常能帶來更好的身體動作。”
“濃重的陰影、墨鏡、奇怪的遮擋和過小的臉,都會增加難度。”
模型是字節跳動的;在這裡用它的理由,是另外兩樣輸入——臉和聲音——都出自同一個工作台。

一條虛擬人短片需要三樣東西:一張臉、一段聲音、一個模型。在這裡三樣都出自同一個工作台——用 GPT Image 2 或 Seedream 生成人像,輸入腳本並用 60 個內建音色之一合成語音,再把兩者直接餵給 OmniHuman 1.5。本頁每條短片都是這樣端到端做出來的:沒有錄過一秒音訊,也沒有上傳過任何真人照片。

文字模式不是附贈品:60 個音色涵蓋英語、中文、日語、韓語、法語、德語、西班牙語、義大利語、俄語和葡萄牙語,每個都能先試聽再花錢。輸入最多 600 個字元,選一個音色,平台就會合成語音並在同一次執行裡驅動虛擬形象。上面的普通話茶館短片走的正是這條路——全程沒碰麥克風。

OmniHuman 1.5 按音訊秒數計費——每秒 130 點數、向上取整——工作台會在你按下生成前顯示這條短片的確切成本。同一方案還涵蓋 GPT Image 2、Nano Banana Pro、Seedream、Seedance、Kling 和 Veo,所以合理的工作流程很省:先花幾枚點數打磨人像、敲定腳本,最後才把點數花在虛擬人秒數上。記得剪掉音訊裡的靜音——每一秒你都在付費。

我們的七條實測短片生成於 2026 年 8 月 19 日——帶貨口播、新聞快訊、健身房動員、普通話茶館歡迎詞、繪本角色、一條故意做砸的四分之三側臉,以及一條寬幅舞台鏡頭。每個被接受的任務都一次成片,約 10 秒音訊耗時 3 分 20 秒到 4 分 42 秒。我們也公開出問題的部分:那個週二晚尖峰,上游用容量報錯拒絕了我們 20 次提交中的 13 次才接單(被拒絕的執行自動退款),有一個任務排隊 14 分鐘,而本頁的側臉短片正展示了無視「正面人像」建議的確切下場。
以下 7 條短片全部於 2026 年 8 月 19 日在本站生成——每條都是這組輸入的第一次成片,沒有重拍、沒有挑片。人像是 GPT Image 2 的產出;每個聲音都由輸入文字經內建音色庫合成。被接受的任務約 10 秒音訊耗時 3 分 20 秒到 4 分 42 秒回傳(有一條排隊 14 分鐘);當晚尖峰時段上游曾以容量不足報錯拒絕了數次提交才接單——被拒絕的執行會退款。請開聲音。
Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."
Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."
Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"
Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"
Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"
Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."
Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."
以下每一條都對應上方演示過的短片——不是願望清單。
輸入旁白文字,螢幕上就有了主講人——不用相機、燈光或重拍。每條 35 秒的上限恰好對應一條講一個概念,而這本來就是多數課程剪輯的切法。
上面的音箱帶貨案例就是完整工作流程:生成一張手持你產品的創作者風格人像,輸入賣點文案,選個音色。沒有出鏡費,也不用去追肖像授權——這張臉從未存在過。
同一張臉可以用十種語言傳達同一條訊息:人像不變,換音色即可。口型同步跟隨你提供的任何音訊——上面的普通話案例就是證明。
你生成的人設就是你擁有的人設。設計一次臉,配上固定的庫內音色,它就能主持每一集節目——上面的繪本角色案例說明它甚至不必是照片級寫實。
最難的部分你已經有了:音訊。剪一段 35 秒以內的精華,配上一張人像,不用打開剪輯軟體就得到一條社群平台可用的影像短片。
口播影片與場景影片——每個模型需要你提供什麼,又在這個工作台裡交回什麼。
| OmniHuman 1.5 | Seedance 2.5 | Veo 3.1 Pro | Kling 3.0 Turbo | |
|---|---|---|---|---|
| 你需要提供什麼 | 1 張人像照片 + 你的音訊,或輸入文字並選一個庫內音色 | 一段提示詞,可選圖像、影片和音訊參考 | 一段提示詞,可選參考圖 | 一段提示詞或一張起始圖 |
| 誰在說這些話 | 你——虛擬形象對你的音軌逐字對口型 | 模型根據提示詞生成配音 | 模型根據提示詞生成配音 | 音訊隨短片一起生成 |
| 此處的片長 | 等於你的音訊長度,最長 35 秒 | 4–30 秒 | 4–8 秒 | 3–15 秒 |
| 點數 | 每秒音訊 130 點數 | 480p 每秒 110 · 720p 每秒 230 | 每條 320–1,920(4–8 秒 · 720p–4K · 含/不含音訊) | 720p 每秒 55 · 1080p 每秒 70 |
| 本站實測 | 約 10 秒音訊約需 4 分鐘(7 條實測,2026 年 8 月) | 未在此任務上實測 | 未在此任務上實測 | 未在此任務上實測 |
點數、時長與輸入選項讀取自本工作台自己的模型註冊表(2026 年 8 月 19 日)——描述的是你在這裡能得到什麼,而不是廠商公布的規格。耗時是我們對上方短片的實測;同樣的腳本我們沒有在另外三個模型上跑過,所以那些格子如實寫明,而不是去猜。
將 OmniHuman 1.5 與其他視訊模型進行比較-相同的工作區,一鍵切換。
| 模型 | omnihuman-1.5,字節跳動出品(研究論文發表於 2025 年 8 月) |
|---|---|
| 模式 | 會說話的虛擬人:一張照片 + 一條音軌 → 口播影片,就在本頁的虛擬人工作台 |
| 輸入 | 恰好 1 張人像,外加最長 35 秒的音訊(上傳 mp3/wav)——或輸入最多 600 字元的文字合成語音 |
| 音色庫 | 60 個內建音色涵蓋 10 種語言:英語、中文、日語、韓語、法語、德語、西班牙語、義大利語、俄語、葡萄牙語 |
| 可選引導 | 一句簡短的表演提示,描述動作、情緒和鏡頭——有用,但從不是必填 |
| 輸出 | 一個保持你照片構圖的連續鏡頭;片長等於音訊長度。實測輸出:2:3 照片得 1248×1664,16:9 得 1920×1088,25 fps,H.264 影片 + 單聲道 AAC 音訊 |
| 點數 | 每秒音訊 130 點數、向上取整——最低 130,滿 35 秒為 4,550;生成前會顯示確切成本 |
| 實測速度 | 7 條實測中,被接受的任務約 10 秒音訊耗時 3 分 20 秒–4 分 42 秒;有一條排隊 14 分鐘(2026 年 8 月,一個繁忙的週二晚上) |
上傳一張清晰、正面、半身的人像——或者就在這個工作台用 GPT Image 2 或 Seedream 生成一張,本頁所有人臉都是這麼來的。一張照片一個人;讓臉大而無遮擋。
上傳一段音訊(mp3 或 wav,最長 35 秒),或切換到文字模式:輸入最多 600 個字元,從 10 種語言的 60 個音色中挑一個,每個都能先試聽。
一句「平靜、輕微點頭、淺淺微笑」這樣的短提示就能引導手勢和情緒。留空的話,模型會自己讀取音訊的節奏與含義。
執行前會顯示確切的點數成本——它隨音訊長度變化。生成是非同步的;短片會連同全部輸入一起進入歷史記錄,可用的設定下週還能原樣重現。
一個帳號,完整的圖像與影片生成工作流程。
用免費方案的每日點數執行 OmniHuman 1.5,或升級以取得進階模型、更快的生成與 4K 輸出。
年繳 · $240/year
字節跳動的音訊驅動虛擬人模型。它接受一張人像照片和一條音軌,回傳這個人說出這段音訊的影片——嘴唇、表情、頭部動作和手勢都跟隨聲音。背後的研究論文發表於 2025 年 8 月。
能——這正是它和提示詞驅動影片模型的區別。你提供音軌:上傳 mp3/wav,或輸入腳本並選擇內建音色,虛擬形象會逐字對口型。提示詞驅動的模型自己生成配音,很少能一字不差地說出你寫的話。
不免費——按音訊每秒 130 點數、向上取整計費,一條 10 秒短片就是 1,300 點數。生成前會顯示確切成本,失敗的執行會自動退款。腳本寫緊湊、剪掉靜音:音訊的每一秒都是你要付費的一秒。
正面、半身、單人,臉要大、光要勻、無遮擋——評測者和我們自己的測試結論一致。上面那條故意做的四分之三側臉測試展示了反例的下場:嘴唇幾乎不動,模型還把頭慢慢轉得更遠,桌上憑空多出了照片裡沒有的東西。生成的人像和相機拍的照片效果完全一樣好。
可以——上面的繪本測試就是一張純 2D 插畫,OmniHuman 1.5 在保住畫風的前提下把它演活了:眼睛、眉毛和嘴都像手繪動畫角色一樣動。我們觀察到一個小怪癖:嘴張大時,模型給這張扁平插畫畫出了意外寫實的牙齒。字節跳動的論文還宣稱支援非人類主體;我們只測過這個插畫角色。
本平台每條最多 35 秒音訊——更長的腳本需要切分再拼接。在我們 2026 年 8 月的測試裡,被接受的任務約 10 秒音訊耗時 3 分 20 秒到 4 分 42 秒回傳。同一晚的一個提醒:高負載時上游會先用容量報錯拒絕幾次提交才接單。被拒絕的執行不花錢,但尖峰時段請把重試時間算進去,不要卡著五分鐘後的死線。
首先是非正面的臉:我們的四分之三側臉測試裡嘴唇幾乎不動,頭還越轉越遠,桌上多出了照片裡沒有的東西。身分細節也可能在片中漂移——那條測試裡耳環換了形狀,另外兩條裡唇色比輸入略深。多人對話在這裡不可用,輸出解析度不高(我們的人像實測為 1248×1664,沒有 4K),而且它只做口播影片:要動作、運鏡或場景變化,請用 Seedance 2.5 或 Kling 3.0 Turbo。
你生成的影片可以在個人和商業專案中使用,須遵守我們的服務條款。臉才是要認真對待的部分:未經同意驅動真人照片可能侵犯肖像權與公開權,多個司法轄區現在還要求揭露合成主持人。生成的臉——比如本頁的每一張——完全繞開了授權問題。
OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.