AI 會說話的照片

上傳一張人像和一段音訊(最長 35 秒),或輸入台詞並挑一個聲音,OmniHuman 1.5 就會把照片變成對嘴同步、動作自然的說話影片。用你自己的照片,自己出鏡。

0 / 2,000
130 cr/s · ≤35s

一張照片,變成會說話的影片

一張人像加上腳本,就成為栩栩如生的代言人——口型、表情、手勢同步。免攝影機、免攝影棚。

原始圖片Original portrait photo of a beauty creator holding a skincare product
腳本

Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.

AI 數字人影片

讓任何一張照片開口說話,包括你自己的

一個完整的 AI 會說話照片(數位人)生成器:上傳一張人像和一段音訊,或輸入台詞並挑一個聲音,就能得到對嘴同步、表情自然、帶手勢的逼真說話影片。用你自己的照片當出鏡者。由字節跳動 OmniHuman 1.5 驅動,不需要相機、演員或攝影棚。

一張裱框的人像照變成同一位女性的會說話 AI 數位人,中間是一段音訊波形

自己出鏡,或打造一位數位代言人

不用拍攝,不用演員,不用綠幕。上傳一張清晰的自拍,你就是唸台詞的出鏡者,用你自己的聲音或聲音庫裡的聲音都可以。也可以用一位已經授權給你的人的照片,打造一位可重複使用的數位主持人,用於產品說明、課程開場、公告和廣告。隨時重新生成新台詞,無需補拍。

AI 會說話照片的兩種輸入:上傳的音訊波形,以及帶聲音選擇器的文字台詞

兩種方式:上傳音訊或輸入腳本。

已經有錄音了?上傳後,虛擬形象會自動進行口型同步。沒有音訊?切換到文字模式-輸入虛擬形象應該說的話,從內建的文字轉語音庫中選擇一個語音,系統會自動將腳本合成到駕駛語音中。生成前會顯示預計時長和所需積分。

AI 會說話照片畫面:一位女性面向鏡頭說話,手勢自然

栩栩如生——不只是一張會動的嘴。

OmniHuman 1.5 能夠解讀音訊的節奏、韻律和意義,從而驅動頭部動作、姿勢和手勢,並實現精準的唇形同步,同時保留人物的身份特徵和光照效果。最終呈現的效果如同真人演講者一般生動自然,而非僅僅是一張嘴巴會動的靜態肖像。

AI 會說話照片出鏡者在客廳裡錄一支社群短片

專為行銷、培訓和社交而設計

您可以快速製作用於廣告和落地頁的發言人視頻、用於培訓的旁白課程和入門教程、用於社交媒體的真人出鏡視頻,或者同一信息的多種語言版本。每一代內容及其輸入都會儲存到歷史記錄中,因此您可以快速迭代並產生各種版本。

可直接用於 AI 會說話照片的人像

在 CreateVision AI 上生成的主播風格人像——只要加上音訊,其中任何一張都能驅動一段會說話的數字人影片。

美妝部落客的AI虛擬形象正在展示一款護膚精華液
人工智慧化身的科技評測員正在展示一款智慧型手機
一位生活風格創造者的AI虛擬形象,手裡拿著一杯咖啡
人工智慧化身的球鞋測評員正在展示一雙鞋
手提包的時尚設計師人工智慧化身
人工智慧化身健康養生專家,介紹保健品
手持香水瓶的美妝達人AI虛擬形象
一位家庭烹飪創作者的AI虛擬形象,配備廚房小工具

這個 AI 會說話的照片生成器背後的模型

本頁的對嘴、表情與肢體動作,由 OmniHuman 1.5 驅動。

AI 會說話照片規格

輸入一張人像照片,再加上一個上傳的音訊檔案或一段打好的腳本。
誰的照片你自己的,或已經授權給你的人的。照片和聲音都必須是你有權使用的。
人像照片建議正面、光線充足、整張臉完整可見且對焦清楚。墨鏡和濃重陰影會降低對嘴的準確度。
音訊長度每次生成最長 35 秒——大約 85 個口說字詞。
音色庫內建 60 種音色,涵蓋 10 種語言,生成前可先試聽。
模型OmniHuman 1.5,負責驅動對嘴、臉部表情,以及自然的頭部與身體動作。
費用和其他影片生成一樣,按輸出秒數計費;生成前會先顯示。
輸出一段可下載的影片,連同原始人像與腳本一起存進你的歷史紀錄。

如何讓自己出鏡:AI 會說話照片三步驟

你的照片,你的話,一支影片。

  1. 1

    上傳一張你自己的照片

    清晰的正面照效果最好:手機自拍、大頭照,或影片裡截的一格都行。會說話照片 AI 只憑這一格讀取你的臉。

  2. 2

    加上你的聲音

    自己錄一段上傳,或輸入台詞並從 60 個內建聲音裡挑一個。音訊最長 35 秒。

  3. 3

    生成,然後反覆用自己

    模型會把嘴型、表情和自然的頭部動作對齊到音訊上。留著同一張照片,需要時隨時生成新台詞,不用補拍。

AI 會說話照片的台詞怎麼寫

這裡沒有圖像提示詞——幹活的是人像和音訊。你寫的是腳本,而腳本上的取捨決定了成果看起來自不自然。

1

開場白

開頭寫短一點。第一秒是對嘴最容易被看清楚的地方。

嘿——簡單跟你說一件事。

2

句子長度

句子控制在大約 15 個字以內。過長的子句會產生不自然的停頓。

這瓶精華只有兩種成分。整個配方就這樣。

3

標點

逗號和句號會變成換氣。你真的會停頓的地方,就打上標點。

它有效——而且只要十秒鐘。

4

篇幅預算

大約每秒 2.5 個字。照你想要的片段長度來寫。

35 秒的片段約需 85 個字

模糊版

我們這款革命性產品運用尖端科技,為追求卓越的挑剔顧客交付無與倫比的成果。

具體版

這就是大家一直在問的那部分。兩種成分,沒有填充料。大概一週你就能看出差別。

為什麼有效

第一段是一個 19 個字的抽象長句——虛擬人唸出來是平板、上氣不接下氣的單調語調,因為根本沒有可以換氣的地方。第二段是三個短句,有自然的重音點,這才是讓唸白聽起來像真人的原因。

模糊版

大家好,歡迎來到我們的頻道,今天我們要討論的是關於保養流程你需要知道的五件最重要的事情。

具體版

關於保養的五件事。第一件,是大多數人都做錯的。

為什麼有效

又長又不斷句的開場,是對嘴最容易走鐘的地方,因為模型沒有標點可以對齊。一句簡短的開場鉤子能給它乾淨的重音點,也更抓得住注意力。

值得戒掉的習慣

  • 用了一張臉很小、側著或有一半落在陰影裡的照片。對嘴的準確度,直接取決於原始畫面裡嘴部有多清楚。
  • 腳本寫超過音訊上限。生成最多 35 秒音訊——更長的腳本會被截斷,所以拆成幾段,重複用同一張人像。
  • 堆疊密集的專業用語。數字、縮寫和冗長的產品名稱,正是合成語音最容易露餡的地方。照你實際唸出來的方式寫。

AI 虛擬人影片產生器之外

會說話的虛擬人只是其中一種產出。圖片與影片生成都在同一個帳號裡運作。

AI 虛擬人影片的實用資源

AI 會說話照片定價與免費點數

會說話照片影片和其他影片輸出一樣按秒計費。新帳號註冊送 200 點數,可以先試試。

免費版

$0

入門的最佳選擇

  • 200 歡迎積分,每日最多使用 80
  • Z Image Turbo 以 0 點數草稿創作
  • 標準生成速度
  • 內含生成歷史紀錄
開始使用

Premium

最受歡迎
$29/month

年繳 · $240/year

  • 每月 8,000 積分,無每日限額
  • 所有進階模型——GPT Image 2、Nano Banana、Seedream、Seedance、Veo、Kling
  • 5 倍生成速度,優先排程
  • AI 提示詞優化
升級到 Premium

Ultimate

$59/month

年繳 · $468/年

  • 每月 18,000 積分,無每日限額
  • 高達 4K 解析度的 HD 生成
  • 優先支援
  • 最快的排程與新模型搶先體驗
升級到 Ultimate

AI 會說話照片 — 常見問題

1

什麼是 AI 會說話的照片?

AI 會說話的照片,也叫 AI 數位人或虛擬分身,是用一張照片和一段聲音生成的人物說話影片。你不用拍攝,只需提供一張人像和音訊(或台詞 + 聲音),模型就會生成一段逼真的說話表演,可用作數位主播、代言人或旁白。

2

創建它需要哪些條件?

一張清晰的正面人像照片,加上一段音訊(mp3/wav格式),或者——在文字模式下——你想朗讀的腳本以及從內建庫中選擇一個聲音。這就足以產生一個會說話的虛擬形象影片。

3

我可以用自己的聲音嗎?

是的。上傳自己的錄音,虛擬形象就會自動進行口型同步。如果您沒有錄音,請切換到文字模式,然後從文字轉語音庫中選擇一個語音。

4

頭像影片最長可以有多長?

每代最多可錄製 35 秒音訊。如果腳本較長,請將其分割成多個片段。預估時長會在您輸入時顯示,音訊按秒計費。

5

AI虛擬形像有哪些用途?

常見用途包括產品說明和廣告、課程和新用戶引導旁白、社交媒體訪談片段、公告以及訊息的多種語言版本——任何需要拍攝主持人的場合。

6

AI虛擬形象採用的是哪一種模式?

CreateVision AI 使用了位元組跳動的 OmniHuman 1.5,它能夠根據音訊驅動唇形同步、頭部動作和手勢。有關技術細節,請參閱 OmniHuman 1.5 模型頁面。

7

AI 虛擬人影片產生器用什麼照片效果最好?

光線充足、面向鏡頭、整張臉完整清晰的人像。墨鏡、臉上的濃重陰影、極端角度,或臉在畫面中佔比太小,都會降低對嘴的準確度。

8

我一定要錄自己的聲音嗎?

不用。你可以直接打字寫台詞,再從內建音色庫裡挑一個聲音,庫裡有涵蓋 10 種語言的 60 個音色。如果你比較想用自己的錄音,也支援上傳。

9

我可以自己出鏡嗎?

可以,這也是最常見的用法。上傳一張你自己的照片,然後要麼錄自己的聲音,要麼輸入台詞並選一個聲音庫裡的聲音。結果就是你本人在說你的話,不需要架相機。很多創作者留著一張好照片,每週都用它生成新的短片。

10

AI 會說話的照片可以商用嗎?

可以。根據 CreateVision AI 服務條款,你生成的內容可用於個人和商業用途,在合適的場合註明由 CreateVision AI 生成即可。你需要自行確保對上傳的照片和聲音擁有使用權,並遵守發布平台關於 AI 內容標示的規則。

11

我以前用 Sora 把自己放進影片裡,這是同一回事嗎?

目標一樣,原理不同。這裡你的照片就是身分,音訊或台詞驅動說話,所以產出是一支對嘴同步的出鏡短片,而不是把你放進某個場景。它只需要任意一張照片,不用錄影登記,也不依賴別的應用程式是否還在。

做你的第一張 AI 會說話的照片

開始創建