会说话的照片 AI

上传一张肖像照片和一段音频(最长 35 秒),OmniHuman 1.5 即可生成一个嘴唇同步、动作自然的会说话的虚拟形象视频。

0 / 2,000
130 cr/s · ≤35s

一张照片,变成会说话的视频

一张人像加一段脚本,就变成栩栩如生的代言人——口型、表情、手势同步。无需相机、无需摄影棚。

原始图片Original portrait photo of a beauty creator holding a skincare product
脚本

Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.

AI 数字人视频

只需一张照片和一段语音,即可制作一个会说话的人工智能化身

一款完整的AI虚拟形象(数字人)生成器:上传头像和音频片段,或者输入脚本并选择配音,即可获得栩栩如生的会说话的视频,唇形同步,表情自然,手势生动。由字节跳动OmniHuman 1.5提供技术支持,无需相机、演员或工作室。

AI 视频截帧:宇航员走过散发光芒的飞船走廊

一张肖像画就能塑造数字发言人

无需拍摄,无需演员,无需绿幕。只需上传一张清晰的人物照片,即可将其变成播报员,并朗读您的脚本。创建可重复使用的数字主持人,用于产品讲解、课程介绍、公告和广告——随时生成新的台词,无需重新拍摄。

AI 视频截帧:雨水顺着咖啡馆窗玻璃流下,背景是温暖的散景光斑

两种方式:上传音频或输入脚本。

已经有录音了?上传后,虚拟形象会自动进行口型同步。没有音频?切换到文本模式——输入虚拟形象应该说的话,从内置的文本转语音库中选择一个语音,系统会自动将脚本合成到驾驶语音中。生成前会显示预计时长和所需积分。

AI 视频截帧:琥珀色灯光下,烟雾舞台上的舞者剪影

栩栩如生——不仅仅是一张会动的嘴。

OmniHuman 1.5 能够解读音频的节奏、韵律和含义,从而驱动头部动作、姿势和手势,并实现精准的唇形同步,同时保留人物的身份特征和光照效果。最终呈现的效果如同真人演讲者一般生动自然,而非仅仅是一张嘴巴会动的静态肖像。

AI 视频截帧:北极光在雪中小屋上空盘旋流转

专为市场营销、培训和社交而设计

您可以快速制作用于广告和落地页的发言人视频、用于培训的旁白课程和入门教程、用于社交媒体的真人出镜视频,或者同一信息的多种语言版本。每一代内容及其输入都会被保存到历史记录中,因此您可以快速迭代并生成各种版本。

适合会说话的照片 AI 的人像

在 CreateVision AI 上生成的主播风格人像——只要加上音频,其中任何一张都能驱动一段会说话的数字人视频。

美妆博主的AI虚拟形象正在展示一款护肤精华液
人工智能化身的科技评测员正在展示一款智能手机
一位生活方式创造者的AI虚拟形象,手里拿着一杯咖啡
人工智能化身的球鞋测评员正在展示一双鞋
手提包的时尚设计师人工智能化身
人工智能化身健康养生专家,介绍保健品
手持香水瓶的美妆达人AI虚拟形象
一位家庭烹饪创作者的AI虚拟形象,配备厨房小工具

这个 AI 数字人视频生成器背后的模型

本页的口型同步、表情和肢体动作,由 OmniHuman 1.5 驱动。

AI 数字人视频生成器规格

输入一张人像照片,外加一个上传的音频文件或一段手打的脚本。
人像照片建议正面、光线充足、整张脸完整可见且清晰对焦。墨镜和浓重阴影会降低口型同步的准确度。
音频时长每次生成最长 35 秒——大约 85 个口播词。
音色库内置 60 个音色,覆盖 10 种语言,生成前可试听。
模型OmniHuman 1.5,负责驱动口型同步、面部表情,以及自然的头部和身体动作。
费用和其他视频生成一样按输出秒数计费;生成前会先显示。
输出一段可下载的视频,连同原始人像和脚本一起存进你的历史记录。

会说话的照片 AI 怎么用

一张肖像、一条音轨、一段成片。

  1. 1

    上传一张肖像

    正面、清晰的照片效果最好。AI 数字人视频生成器就是从这一帧里读取人脸的。

  2. 2

    加上声音

    上传一个音频文件,或者打字写台词再从内置音色库里挑一个声音。音频最长 35 秒。

  3. 3

    生成数字人视频

    模型会把口型、表情和自然的头部动作对上音频,并返回一段你可以下载或续接的片段。

如何为 AI 数字人视频生成器写脚本

这里没有图像提示词——干活的是人像和音频。你写的是脚本,而脚本上的取舍决定了成片看起来自不自然。

1

开场白

开头写短一点。第一秒是口型最容易被看清的地方。

嘿——简单跟你说一件事。

2

句子长度

句子控制在 15 个词左右以内。长从句会带出不自然的停顿。

这瓶精华只有两种成分。整个配方就这些。

3

标点

逗号和句号会变成换气。你真正会停顿的地方,就打上标点。

它有效——而且只要十秒钟。

4

篇幅预算

大约每秒 2.5 个词。按你想要的片段时长来写。

35 秒的片段约需 85 个词

模糊版

我们这款革命性产品运用前沿科技,为追求卓越的挑剔客户交付无与伦比的成果。

具体版

这就是大家总在问的那部分。两种成分,没有填充料。大概一周你就能看出差别。

为什么有效

第一条是一个 19 个词的抽象长句——数字人念出来是平板、上气不接下气的单调线,因为根本没有可以换气的地方。第二条是三个短句,带自然的重音点,这才是让念白听起来像真人的原因。

模糊版

大家好,欢迎来到我们的频道,今天我们要讨论的是关于护肤流程你需要知道的五件最重要的事情。

具体版

关于护肤的五件事。第一件,是大多数人都做错的。

为什么有效

又长又不断句的开场,是口型最容易失准的地方,因为模型没有标点可以对齐。一句短钩子能给它干净的重音点,也更抓得住注意力。

值得戒掉的习惯

  • 用了一张人脸很小、侧着或有一半落在阴影里的照片。口型同步的准确度,直接取决于原图里嘴部有多清楚。
  • 脚本写超了音频上限。生成最多 35 秒音频——更长的脚本会被截断,所以拆成几段,重复用同一张人像。
  • 堆砌密集的专业表述。数字、缩写和冗长的产品名,正是合成语音最容易露馅的地方。按你实际念出来的方式写。

AI 数字人视频生成器之外

会说话的数字人只是其中一种产出。图片和视频生成都在同一个账号里跑。

AI 数字人视频相关的实用资源

AI 数字人视频生成器定价与每日免费积分

数字人视频和其他视频一样按秒计费。免费账号每天有 80 积分可以先试试。

免费版

$0

新手入门的理想之选

  • 200 欢迎积分,每日最多使用 80
  • Z Image Turbo 以 0 积分打稿
  • 标准生成速度
  • 包含生成历史记录
开始使用

高级版

最受欢迎
$29/month

按年计费 · $240/year

  • 每月 8,000 积分,无每日限额
  • 全部高级模型——GPT Image 2、Nano Banana、Seedream、Seedance、Veo、Kling
  • 5 倍生成速度,优先排队
  • AI 提示词增强
升级到 高级版

Ultimate

$49/month

按年计费 · $380/year

  • 每月 18,000 积分,无每日限额
  • 最高 4K 分辨率的高清生成
  • 优先支持
  • 最快的生成队列与新模型抢先体验
升级到 Ultimate

AI 数字人视频生成器 — 常见问题

1

什么是人工智能化身(数字人)?

人工智能化身是由一张照片和一段语音生成的真人视频。无需拍摄,只需提供一张照片和一段音频(或一段脚本+语音),模型即可生成栩栩如生的语音表演——可用作数字主持人、发言人或旁白。

2

创建它需要哪些条件?

一张清晰的正面人像照片,加上一段音频(mp3/wav格式),或者——在文本模式下——你想朗读的脚本以及从内置库中选择一个声音。这就足以生成一个会说话的虚拟形象视频。

3

我可以用自己的声音吗?

是的。上传您自己的录音,虚拟形象就会自动进行口型同步。如果您没有录音,请切换到文本模式,然后从文本转语音库中选择一个语音。

4

头像视频最长可以有多长?

每代最多可录制 35 秒音频。如果脚本较长,请将其分割成多个片段。预估时长会在您输入时显示,音频按秒计费。

5

AI虚拟形象有哪些用途?

常见用途包括产品说明和广告、课程和新用户引导旁白、社交媒体访谈片段、公告以及信息的多种语言版本——任何需要拍摄主持人的场合。

6

AI虚拟形象采用的是哪种模型?

CreateVision AI 使用了字节跳动的 OmniHuman 1.5,它能够根据音频驱动唇形同步、头部动作和手势。有关技术细节,请参阅 OmniHuman 1.5 模型页面。

7

AI 数字人视频生成器用什么照片效果最好?

光线充足、面向镜头、整张脸完整清晰的肖像。墨镜、脸上的浓重阴影、极端角度,或人脸在画面中占比过小,都会降低口型同步的准确度。

8

我必须录自己的声音吗?

不用。你可以直接打字写台词,再从内置音色库里挑一个声音,库里有覆盖 10 种语言的 60 个音色。如果你更想用自己的录音,也支持上传。

9

AI 数字人视频最长能做多久?

每次生成最多 35 秒音频。要做更长的演示,可以分几段生成再拼接——用同一张源肖像,能让主讲人在各段之间保持一致。

创建你的第一个会说话的AI虚拟形象

开始创建