一幅肖像畫就能塑造數位發言人
無需拍攝,無需演員,無需綠幕。只需上傳一張清晰的人物照片,即可將其變成播報員,並朗讀您的腳本。創建可重複使用的數位主持人,用於產品講解、課程介紹、公告和廣告——隨時生成新的台詞,無需重新拍攝。
上傳一張肖像照片和一段音訊(最長 35 秒),OmniHuman 1.5 即可產生一個嘴唇同步、動作自然的會說話的虛擬形象影片。
一張人像加上腳本,就成為栩栩如生的代言人——口型、表情、手勢同步。免攝影機、免攝影棚。
Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.
一款完整的AI虛擬形象(數位人)生成器:上傳頭像和音頻片段,或者輸入腳本並選擇配音,即可獲得栩栩如生的會說話的視頻,唇形同步,表情自然,手勢生動。由位元組跳動OmniHuman 1.5提供技術支持,無需相機、演員或工作室。
無需拍攝,無需演員,無需綠幕。只需上傳一張清晰的人物照片,即可將其變成播報員,並朗讀您的腳本。創建可重複使用的數位主持人,用於產品講解、課程介紹、公告和廣告——隨時生成新的台詞,無需重新拍攝。
已經有錄音了?上傳後,虛擬形象會自動進行口型同步。沒有音訊?切換到文字模式-輸入虛擬形象應該說的話,從內建的文字轉語音庫中選擇一個語音,系統會自動將腳本合成到駕駛語音中。生成前會顯示預計時長和所需積分。
OmniHuman 1.5 能夠解讀音訊的節奏、韻律和意義,從而驅動頭部動作、姿勢和手勢,並實現精準的唇形同步,同時保留人物的身份特徵和光照效果。最終呈現的效果如同真人演講者一般生動自然,而非僅僅是一張嘴巴會動的靜態肖像。
您可以快速製作用於廣告和落地頁的發言人視頻、用於培訓的旁白課程和入門教程、用於社交媒體的真人出鏡視頻,或者同一信息的多種語言版本。每一代內容及其輸入都會儲存到歷史記錄中,因此您可以快速迭代並產生各種版本。
在 CreateVision AI 上生成的主播風格人像——只要加上音訊,其中任何一張都能驅動一段會說話的數字人影片。
本頁的對嘴、表情與肢體動作,由 OmniHuman 1.5 驅動。
| 輸入 | 一張人像照片,再加上一個上傳的音訊檔案或一段打好的腳本。 |
|---|---|
| 人像照片建議 | 正面、光線充足、整張臉完整可見且對焦清楚。墨鏡和濃重陰影會降低對嘴的準確度。 |
| 音訊長度 | 每次生成最長 35 秒——大約 85 個口說字詞。 |
| 音色庫 | 內建 60 種音色,涵蓋 10 種語言,生成前可先試聽。 |
| 模型 | OmniHuman 1.5,負責驅動對嘴、臉部表情,以及自然的頭部與身體動作。 |
| 費用 | 和其他影片生成一樣,按輸出秒數計費;生成前會先顯示。 |
| 輸出 | 一段可下載的影片,連同原始人像與腳本一起存進你的歷史紀錄。 |
一張人像、一段配音、一支成片。
正面、清晰的照片效果最好。AI 虛擬人影片產生器就是從這一格畫面讀取臉部的。
上傳一個音訊檔,或打字寫台詞再從內建音色庫裡挑一個聲音。音訊最長 35 秒。
模型會把嘴型、表情與自然的頭部動作對上音訊,並回傳一段你可以下載或續接的影片。
這裡沒有圖像提示詞——幹活的是人像和音訊。你寫的是腳本,而腳本上的取捨決定了成果看起來自不自然。
開頭寫短一點。第一秒是對嘴最容易被看清楚的地方。
嘿——簡單跟你說一件事。
句子控制在大約 15 個字以內。過長的子句會產生不自然的停頓。
這瓶精華只有兩種成分。整個配方就這樣。
逗號和句號會變成換氣。你真的會停頓的地方,就打上標點。
它有效——而且只要十秒鐘。
大約每秒 2.5 個字。照你想要的片段長度來寫。
35 秒的片段約需 85 個字
我們這款革命性產品運用尖端科技,為追求卓越的挑剔顧客交付無與倫比的成果。
這就是大家一直在問的那部分。兩種成分,沒有填充料。大概一週你就能看出差別。
第一段是一個 19 個字的抽象長句——虛擬人唸出來是平板、上氣不接下氣的單調語調,因為根本沒有可以換氣的地方。第二段是三個短句,有自然的重音點,這才是讓唸白聽起來像真人的原因。
大家好,歡迎來到我們的頻道,今天我們要討論的是關於保養流程你需要知道的五件最重要的事情。
關於保養的五件事。第一件,是大多數人都做錯的。
又長又不斷句的開場,是對嘴最容易走鐘的地方,因為模型沒有標點可以對齊。一句簡短的開場鉤子能給它乾淨的重音點,也更抓得住注意力。
會說話的虛擬人只是其中一種產出。圖片與影片生成都在同一個帳號裡運作。
虛擬人影片和其他影片一樣按秒計費。免費帳號每天有 80 點數可以先試試。
年繳 · $240/year
人工智慧化身是由一張照片和一段語音產生的真人影片。無需拍攝,只需提供一張照片和一段音訊(或一段腳本+語音),模型即可產生栩栩如生的語音表演——可用作數位主持人、發言人或旁白。
一張清晰的正面人像照片,加上一段音訊(mp3/wav格式),或者——在文字模式下——你想朗讀的腳本以及從內建庫中選擇一個聲音。這就足以產生一個會說話的虛擬形象影片。
是的。上傳自己的錄音,虛擬形象就會自動進行口型同步。如果您沒有錄音,請切換到文字模式,然後從文字轉語音庫中選擇一個語音。
每代最多可錄製 35 秒音訊。如果腳本較長,請將其分割成多個片段。預估時長會在您輸入時顯示,音訊按秒計費。
常見用途包括產品說明和廣告、課程和新用戶引導旁白、社交媒體訪談片段、公告以及訊息的多種語言版本——任何需要拍攝主持人的場合。
CreateVision AI 使用了位元組跳動的 OmniHuman 1.5,它能夠根據音訊驅動唇形同步、頭部動作和手勢。有關技術細節,請參閱 OmniHuman 1.5 模型頁面。
光線充足、面向鏡頭、整張臉完整清晰的人像。墨鏡、臉上的濃重陰影、極端角度,或臉在畫面中佔比太小,都會降低對嘴的準確度。
不用。你可以直接打字寫台詞,再從內建音色庫裡挑一個聲音,庫裡有涵蓋 10 種語言的 60 個音色。如果你比較想用自己的錄音,也支援上傳。
每次生成最多 35 秒音訊。要做更長的簡報,可以分成幾段生成再串起來——用同一張來源人像,能讓主講人在各段之間保持一致。