
一张照片加一段声音,就能变成一个会说话的虚拟形象
只需提供一张人物肖像和一段音频,OmniHuman 1.5 就能将人物面部动画化,使其呈现出逼真的说话表演,并实现精准的唇形同步,同时保留人物的身份、面部结构和光照特征。无需绑定骨骼、绿幕或摄影棚。
使用 OmniHuman 1.5 将一张肖像照栩栩如生地呈现出来——上传一张照片和一段音频(或输入文本并选择一种声音),即可生成一个逼真的会说话的虚拟化身,其嘴唇、表情和手势均与照片同步。
将 OmniHuman 1.5 与其他视频模型进行比较——相同的工作区,一键切换。
字节跳动的 OmniHuman 1.5 可仅凭音频生成人像:同步的唇形、自然的表情以及能够根据语音节奏和含义做出相应反应的全身动作——而不仅仅是嘴部动作。上传照片和视频片段,或者输入文字并选择配音。

只需提供一张人物肖像和一段音频,OmniHuman 1.5 就能将人物面部动画化,使其呈现出逼真的说话表演,并实现精准的唇形同步,同时保留人物的身份、面部结构和光照特征。无需绑定骨骼、绿幕或摄影棚。

与基本的会说话的头像工具不同,OmniHuman 1.5 会读取音频的节奏、韵律和含义,从而驱动头部运动、姿势变化和手势——因此,虚拟化身会像真正的演讲者一样强调、停顿和做出反应,而不是像一个嘴巴会动的静态肖像。

没有音频素材?切换到文本模式:输入虚拟形象应该说的话,从内置的文本转语音库中选择一个语音,OmniHuman 1.5 即可为您生成语音。非常适合脚本式演讲、讲解和社交媒体短片。

该模型可适应不同的音频风格——平静的旁白、富有表现力的对话,甚至是歌唱——并且可以遵循可选的文本指导来控制镜头和手势方向,从而产生适用于营销、培训和社交内容的精美效果。
从空白提示词框到一段成片,只要三步。
打开模型选择器,选择 OmniHuman 1.5。在你花掉任何积分之前,面板就会显示它的积分费用、分辨率选项与时长上限。
写清主体、动作,以及镜头怎么运动。想让片子从某张图开始,就附上首帧。
下载成片、延长它,或送去进一步编辑。提示词、模型与设置都会一同保存在你的历史记录里。
一个账户,打通图像与视频生成全流程。
用免费额度的每日积分运行 OmniHuman 1.5,或升级以获得高级模型、更快生成与 4K 输出。
按年计费 · $240/year
按年计费 · $300/year
OmniHuman 1.5 是字节跳动的音频驱动型虚拟形象模型:它将单个肖像加上语音轨道转换为逼真的会说话的视频,嘴唇、表情和手势同步。
一张清晰的单人肖像照片,加上一段音频片段(mp3/wav),或者——在文本模式下——你想朗读的文本,以及从内置库中选择的声音,该声音将被合成到驱动音频中。
每代音频时长最多35秒。较长的脚本最好分成多个片段。计费方式为音频时长(秒),向上取整。
是的。OmniHuman 1.5 能够根据音频的节奏和含义生成头部动作、姿势和手势,因此虚拟化身能够做出相应的表演,而不仅仅是口型同步。
照片要求拍摄对象为一位清晰可见、正面朝向观众、光线充足且面部无遮挡的单人照。合影、脸部过小或面部严重遮挡都会降低照片质量,甚至可能导致照片失败。
按秒计费,每次生成音频均需付费。生成前会显示确切的积分消耗,失败的运行将自动退款。
OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.