
一張照片加上一段聲音,就能變成會說話的虛擬形象
只需提供一張人物肖像和一段音頻,OmniHuman 1.5 就能將人物面部動畫化,使其呈現出逼真的說話表演,並實現精準的唇形同步,同時保留人物的身份、面部結構和光照特徵。無需綁定骨骼、綠幕或攝影棚。
使用 OmniHuman 1.5 將肖像畫栩栩如生地呈現出來——上傳一張照片和一段音訊(或輸入文字並選擇一種聲音),即可產生一個逼真的會說話的虛擬化身,其嘴唇、表情和手勢均與照片同步。
將 OmniHuman 1.5 與其他視訊模型進行比較-相同的工作區,一鍵切換。
字節跳動的 OmniHuman 1.5 可僅憑音頻生成人像:同步的唇形、自然的表情以及能夠根據語音節奏和含義做出相應反應的全身動作——而不僅僅是嘴部動作。上傳照片和影片片段,或輸入文字並選擇配音。

只需提供一張人物肖像和一段音頻,OmniHuman 1.5 就能將人物面部動畫化,使其呈現出逼真的說話表演,並實現精準的唇形同步,同時保留人物的身份、面部結構和光照特徵。無需綁定骨骼、綠幕或攝影棚。

與基本的會說話的頭像工具不同,OmniHuman 1.5 會讀取音頻的節奏、韻律和含義,從而驅動頭部運動、姿勢變化和手勢——因此,虛擬化身會像真正的演講者一樣強調、停頓和做出反應,而不是像一個嘴巴會動的靜態肖像。

沒有音訊素材?切換到文字模式:輸入虛擬形象該說的話,從內建的文字轉語音庫中選擇一個語音,OmniHuman 1.5 即可為您產生語音。非常適合腳本式演講、解說和社群媒體短片。

該模型可適應不同的音頻風格——平靜的旁白、富有表現力的對話,甚至是歌唱——並且可以遵循可選的文本指導來控制鏡頭和手勢方向,從而產生適用於營銷、培訓和社交內容的精美效果。
從空白的提示詞欄位到一支成片,只要三個步驟。
打開模型選擇器,選擇 OmniHuman 1.5。在你花掉任何點數之前,面板就會顯示它的點數費用、解析度選項與時長上限。
寫清楚主體、動作,以及鏡頭怎麼運鏡。想讓影片從某張圖開始,就附上首影格。
下載成片、延長它,或送去進一步編輯。提示詞、模型與設定都會一併保存在你的歷史紀錄裡。
一個帳號,完整的圖像與影片生成工作流程。
用免費方案的每日點數執行 OmniHuman 1.5,或升級以取得進階模型、更快的生成與 4K 輸出。
年繳 · $240/year
年繳 · $300/year
OmniHuman 1.5 是位元組跳動的音頻驅動型虛擬形像模型:它將單個肖像加上語音軌道轉換為逼真的會說話的視頻,嘴唇、表情和手勢同步。
一張清晰的單人肖像照片,加上一段音頻片段(mp3/wav),或者——在文本模式下——你想朗讀的文本,以及從內置庫中選擇的聲音,該聲音將被合成到驅動音頻中。
每代音訊時長最多35秒。較長的腳本最好分成多個片段。計費方式為音訊時長(秒),向上取整。
是的。 OmniHuman 1.5 能夠根據音訊的節奏和意義產生頭部動作、姿勢和手勢,因此虛擬化身能夠做出相應的表演,而不僅僅是口型同步。
照片要求拍攝對象為一位清晰可見、正面朝向觀眾、光線充足且臉部無遮蔽的單人照。合照、臉部過小或臉部嚴重遮擋都會降低照片質量,甚至可能導致照片失敗。
按秒計費,每次產生音訊均需付費。生成前會顯示確切的積分消耗,產生失敗的訂單會自動退款。
OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.