OmniHuman 1.5 人工智能头像生成器

使用 OmniHuman 1.5 将一张肖像照栩栩如生地呈现出来——上传一张照片和一段音频(或输入文本并选择一种声音),即可生成一个逼真的会说话的虚拟化身,其嘴唇、表情和手势均与照片同步。

照片 + 语音 → 视频音频驱动的手势TTS语音库
0 / 2,000
130 cr/s · ≤35s

更多类似 OmniHuman 1.5 的视频模型

将 OmniHuman 1.5 与其他视频模型进行比较——相同的工作区,一键切换。

OmniHuman 1.5 — 将一张照片和一段声音变成栩栩如生的会说话的虚拟化身

字节跳动的 OmniHuman 1.5 可仅凭音频生成人像:同步的唇形、自然的表情以及能够根据语音节奏和含义做出相应反应的全身动作——而不仅仅是嘴部动作。上传照片和视频片段,或者输入文字并选择配音。

AI 视频截帧:琥珀色灯光下,烟雾舞台上的舞者剪影

一张照片加一段声音,就能变成一个会说话的虚拟形象

只需提供一张人物肖像和一段音频,OmniHuman 1.5 就能将人物面部动画化,使其呈现出逼真的说话表演,并实现精准的唇形同步,同时保留人物的身份、面部结构和光照特征。无需绑定骨骼、绿幕或摄影棚。

AI 视频截帧:宇航员走过散发光芒的飞船走廊

全身运动,而不仅仅是嘴唇的运动

与基本的会说话的头像工具不同,OmniHuman 1.5 会读取音频的节奏、韵律和含义,从而驱动头部运动、姿势变化和手势——因此,虚拟化身会像真正的演讲者一样强调、停顿和做出反应,而不是像一个嘴巴会动的静态肖像。

AI 视频截帧:雨水顺着咖啡馆窗玻璃流下,背景是温暖的散景光斑

输入文字,选择语音——无需录音

没有音频素材?切换到文本模式:输入虚拟形象应该说的话,从内置的文本转语音库中选择一个语音,OmniHuman 1.5 即可为您生成语音。非常适合脚本式演讲、讲解和社交媒体短片。

AI 视频截帧:北极光在雪中小屋上空盘旋流转

旁白、对话或歌唱

该模型可适应不同的音频风格——平静的旁白、富有表现力的对话,甚至是歌唱——并且可以遵循可选的文本指导来控制镜头和手势方向,从而产生适用于营销、培训和社交内容的精美效果。

OmniHuman 1.5 怎么用

从空白提示词框到一段成片,只要三步。

  1. 1

    选择 OmniHuman 1.5

    打开模型选择器,选择 OmniHuman 1.5。在你花掉任何积分之前,面板就会显示它的积分费用、分辨率选项与时长上限。

  2. 2

    描述你想要的画面

    写清主体、动作,以及镜头怎么运动。想让片子从某张图开始,就附上首帧。

  3. 3

    生成之后,继续往下做

    下载成片、延长它,或送去进一步编辑。提示词、模型与设置都会一同保存在你的历史记录里。

OmniHuman 1.5 之外

一个账户,打通图像与视频生成全流程。

OmniHuman 1.5 价格与每日免费积分

用免费额度的每日积分运行 OmniHuman 1.5,或升级以获得高级模型、更快生成与 4K 输出。

免费版

$0

新手入门的理想之选

  • 每天 80 积分,每月 400 积分
  • Z Image Turbo 以 0 积分打稿
  • 标准生成速度
  • 包含生成历史记录
开始使用

高级版

最受欢迎
$29/month

按年计费 · $240/year

  • 每天 1,600 积分,每月 8,000 积分
  • 全部高级模型——GPT Image 2、Nano Banana、Seedream、Seedance、Veo、Kling
  • 5 倍生成速度,优先排队
  • AI 提示词增强
升级到 高级版

Ultimate

$49/month

按年计费 · $300/year

  • 每天 4,000 积分,每月 18,000 积分
  • 最高 4K 分辨率的高清生成
  • 优先支持
  • 最快的生成队列与新模型抢先体验
升级到 Ultimate

OmniHuman 1.5 — 常见问题

1

什么是 OmniHuman 1.5?

OmniHuman 1.5 是字节跳动的音频驱动型虚拟形象模型:它将单个肖像加上语音轨道转换为逼真的会说话的视频,嘴唇、表情和手势同步。

2

我需要提供什么?

一张清晰的单人肖像照片,加上一段音频片段(mp3/wav),或者——在文本模式下——你想朗读的文本,以及从内置库中选择的声音,该声音将被合成到驱动音频中。

3

头像片段最长可以有多长?

每代音频时长最多35秒。较长的脚本最好分成多个片段。计费方式为音频时长(秒),向上取整。

4

它比嘴巴活动得更多吗?

是的。OmniHuman 1.5 能够根据音频的节奏和含义生成头部动作、姿势和手势,因此虚拟化身能够做出相应的表演,而不仅仅是口型同步。

5

好的素材照片应该具备哪些条件?

照片要求拍摄对象为一位清晰可见、正面朝向观众、光线充足且面部无遮挡的单人照。合影、脸部过小或面部严重遮挡都会降低照片质量,甚至可能导致照片失败。

6

OmniHuman 1.5 的定价是多少?

按秒计费,每次生成音频均需付费。生成前会显示确切的积分消耗,失败的运行将自动退款。

使用 OmniHuman 1.5 让您的照片栩栩如生

开始生成视频

最近更新OmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.