一张肖像画就能塑造数字发言人
无需拍摄,无需演员,无需绿幕。只需上传一张清晰的人物照片,即可将其变成播报员,并朗读您的脚本。创建可重复使用的数字主持人,用于产品讲解、课程介绍、公告和广告——随时生成新的台词,无需重新拍摄。
上传一张肖像照片和一段音频(最长 35 秒),OmniHuman 1.5 即可生成一个嘴唇同步、动作自然的会说话的虚拟形象视频。
一张人像加一段脚本,就变成栩栩如生的代言人——口型、表情、手势同步。无需相机、无需摄影棚。
Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.
一款完整的AI虚拟形象(数字人)生成器:上传头像和音频片段,或者输入脚本并选择配音,即可获得栩栩如生的会说话的视频,唇形同步,表情自然,手势生动。由字节跳动OmniHuman 1.5提供技术支持,无需相机、演员或工作室。
无需拍摄,无需演员,无需绿幕。只需上传一张清晰的人物照片,即可将其变成播报员,并朗读您的脚本。创建可重复使用的数字主持人,用于产品讲解、课程介绍、公告和广告——随时生成新的台词,无需重新拍摄。
已经有录音了?上传后,虚拟形象会自动进行口型同步。没有音频?切换到文本模式——输入虚拟形象应该说的话,从内置的文本转语音库中选择一个语音,系统会自动将脚本合成到驾驶语音中。生成前会显示预计时长和所需积分。
OmniHuman 1.5 能够解读音频的节奏、韵律和含义,从而驱动头部动作、姿势和手势,并实现精准的唇形同步,同时保留人物的身份特征和光照效果。最终呈现的效果如同真人演讲者一般生动自然,而非仅仅是一张嘴巴会动的静态肖像。
您可以快速制作用于广告和落地页的发言人视频、用于培训的旁白课程和入门教程、用于社交媒体的真人出镜视频,或者同一信息的多种语言版本。每一代内容及其输入都会被保存到历史记录中,因此您可以快速迭代并生成各种版本。
在 CreateVision AI 上生成的主播风格人像——只要加上音频,其中任何一张都能驱动一段会说话的数字人视频。
本页的口型同步、表情和肢体动作,由 OmniHuman 1.5 驱动。
| 输入 | 一张人像照片,外加一个上传的音频文件或一段手打的脚本。 |
|---|---|
| 人像照片建议 | 正面、光线充足、整张脸完整可见且清晰对焦。墨镜和浓重阴影会降低口型同步的准确度。 |
| 音频时长 | 每次生成最长 35 秒——大约 85 个口播词。 |
| 音色库 | 内置 60 个音色,覆盖 10 种语言,生成前可试听。 |
| 模型 | OmniHuman 1.5,负责驱动口型同步、面部表情,以及自然的头部和身体动作。 |
| 费用 | 和其他视频生成一样按输出秒数计费;生成前会先显示。 |
| 输出 | 一段可下载的视频,连同原始人像和脚本一起存进你的历史记录。 |
一张肖像、一条音轨、一段成片。
正面、清晰的照片效果最好。AI 数字人视频生成器就是从这一帧里读取人脸的。
上传一个音频文件,或者打字写台词再从内置音色库里挑一个声音。音频最长 35 秒。
模型会把口型、表情和自然的头部动作对上音频,并返回一段你可以下载或续接的片段。
这里没有图像提示词——干活的是人像和音频。你写的是脚本,而脚本上的取舍决定了成片看起来自不自然。
开头写短一点。第一秒是口型最容易被看清的地方。
嘿——简单跟你说一件事。
句子控制在 15 个词左右以内。长从句会带出不自然的停顿。
这瓶精华只有两种成分。整个配方就这些。
逗号和句号会变成换气。你真正会停顿的地方,就打上标点。
它有效——而且只要十秒钟。
大约每秒 2.5 个词。按你想要的片段时长来写。
35 秒的片段约需 85 个词
我们这款革命性产品运用前沿科技,为追求卓越的挑剔客户交付无与伦比的成果。
这就是大家总在问的那部分。两种成分,没有填充料。大概一周你就能看出差别。
第一条是一个 19 个词的抽象长句——数字人念出来是平板、上气不接下气的单调线,因为根本没有可以换气的地方。第二条是三个短句,带自然的重音点,这才是让念白听起来像真人的原因。
大家好,欢迎来到我们的频道,今天我们要讨论的是关于护肤流程你需要知道的五件最重要的事情。
关于护肤的五件事。第一件,是大多数人都做错的。
又长又不断句的开场,是口型最容易失准的地方,因为模型没有标点可以对齐。一句短钩子能给它干净的重音点,也更抓得住注意力。
会说话的数字人只是其中一种产出。图片和视频生成都在同一个账号里跑。
数字人视频和其他视频一样按秒计费。免费账号每天有 80 积分可以先试试。
按年计费 · $240/year
人工智能化身是由一张照片和一段语音生成的真人视频。无需拍摄,只需提供一张照片和一段音频(或一段脚本+语音),模型即可生成栩栩如生的语音表演——可用作数字主持人、发言人或旁白。
一张清晰的正面人像照片,加上一段音频(mp3/wav格式),或者——在文本模式下——你想朗读的脚本以及从内置库中选择一个声音。这就足以生成一个会说话的虚拟形象视频。
是的。上传您自己的录音,虚拟形象就会自动进行口型同步。如果您没有录音,请切换到文本模式,然后从文本转语音库中选择一个语音。
每代最多可录制 35 秒音频。如果脚本较长,请将其分割成多个片段。预估时长会在您输入时显示,音频按秒计费。
常见用途包括产品说明和广告、课程和新用户引导旁白、社交媒体访谈片段、公告以及信息的多种语言版本——任何需要拍摄主持人的场合。
CreateVision AI 使用了字节跳动的 OmniHuman 1.5,它能够根据音频驱动唇形同步、头部动作和手势。有关技术细节,请参阅 OmniHuman 1.5 模型页面。
光线充足、面向镜头、整张脸完整清晰的肖像。墨镜、脸上的浓重阴影、极端角度,或人脸在画面中占比过小,都会降低口型同步的准确度。
不用。你可以直接打字写台词,再从内置音色库里挑一个声音,库里有覆盖 10 种语言的 60 个音色。如果你更想用自己的录音,也支持上传。
每次生成最多 35 秒音频。要做更长的演示,可以分几段生成再拼接——用同一张源肖像,能让主讲人在各段之间保持一致。