
整条输入链都在同一页上
一条数字人短片需要三样东西:一张脸、一段声音、一个模型。在这里三样都出自同一个工作台——用 GPT Image 2 或 Seedream 生成人像,输入脚本并用 60 个内置音色之一合成语音,再把两者直接喂给 OmniHuman 1.5。本页每条短片都是这样端到端做出来的:没有录过一秒音频,也没有上传过任何真人照片。
给 OmniHuman 1.5 一张人像和一段人声,它还你一段这个人一字不差说出你那段话的视频——口型、表情和手势都跟着声音走。
OmniHuman 1.5 是 ByteDance 的音频驱动数字人模型:给它一张人像和一段人声,它还你一段这个人说这段音频的视频——口型、表情、头部动作和手势全部由声音驱动。和提示词驱动的视频模型不同,说哪些字由你来给。论文里把一个多模态语言模型和一个扩散 Transformer 接在一起,所以表演会对说的内容做出反应,而不只是跟着嘴动。
话说在前面:它需要正面人像。下面那条四分之三侧脸的测试里,嘴几乎没张开,头还越偏越远。每次生成的音频上限 35 秒,稿子更长就得切开分段再拼接;多人对话——论文里的招牌功能——这里没有。它做的是说话视频,不是场景视频:要镜头运动或动作,用 Seedance 2.5 或 Kling 3.0 Turbo。
架构、定位与用户研究数据来自字节跳动研究论文: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)
“1.5 版在高难度输入上表现出更强的稳健性。”
“一张手和肩膀清晰可见、光线自然的半身人像,通常能带来更好的身体动作。”
“浓重的阴影、墨镜、奇怪的遮挡和过小的脸,都会增加难度。”
模型是字节跳动的;在这里用它的理由,是另外两样输入——脸和声音——都出自同一个工作台。

一条数字人短片需要三样东西:一张脸、一段声音、一个模型。在这里三样都出自同一个工作台——用 GPT Image 2 或 Seedream 生成人像,输入脚本并用 60 个内置音色之一合成语音,再把两者直接喂给 OmniHuman 1.5。本页每条短片都是这样端到端做出来的:没有录过一秒音频,也没有上传过任何真人照片。

文字模式不是附赠品:60 个音色覆盖英语、中文、日语、韩语、法语、德语、西班牙语、意大利语、俄语和葡萄牙语,每个都能先试听再花钱。输入最多 600 个字符,选一个音色,平台就会合成语音并在同一次运行里驱动虚拟形象。上面的普通话茶馆短片走的正是这条路——全程没碰麦克风。

OmniHuman 1.5 按音频秒计费——每秒 130 积分、向上取整——工作台会在你按下生成前显示这条短片的确切成本。同一套餐还覆盖 GPT Image 2、Nano Banana Pro、Seedream、Seedance、Kling 和 Veo,所以合理的工作流很省:先花几枚积分打磨人像、敲定脚本,最后才把积分花在数字人秒数上。记得剪掉音频里的静音——每一秒你都在付费。

我们的七条实测短片生成于 2026 年 8 月 19 日——带货口播、新闻快讯、健身房动员、普通话茶馆欢迎词、绘本角色、一条故意做砸的四分之三侧脸,以及一条宽幅舞台镜头。每个被接受的任务都一次成片,约 10 秒音频耗时 3 分 20 秒到 4 分 42 秒。我们也公开出问题的部分:那个周二晚高峰,上游用容量报错拒绝了我们 20 次提交中的 13 次才接单(被拒绝的运行自动退款),有一个任务排队 14 分钟,而本页的侧脸短片正展示了无视「正面人像」建议的确切下场。
以下 7 条短片全部于 2026 年 8 月 19 日在本站生成——每条都是这组输入的第一次成片,没有重拍、没有挑片。人像是 GPT Image 2 的产出;每个声音都由输入文字经内置音色库合成。被接受的任务约 10 秒音频耗时 3 分 20 秒到 4 分 42 秒返回(有一条排队 14 分钟);当晚高峰时段上游曾以容量不足报错拒绝了数次提交才接单——被拒绝的运行会退款。请开声音。
Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."
Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."
Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"
Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"
Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"
Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."
Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."
以下每一条都对应上方演示过的短片——不是愿望清单。
输入旁白文字,屏幕上就有了主讲人——不用相机、灯光或重拍。每条 35 秒的上限恰好对应一条讲一个概念,而这本来就是多数课程剪辑的切法。
上面的音箱带货案例就是完整工作流:生成一张手持你产品的创作者风格人像,输入卖点文案,选个音色。没有出镜费,也不用去追肖像授权——这张脸从未存在过。
同一张脸可以用十种语言传达同一条信息:人像不变,换音色即可。口型同步跟随你提供的任何音频——上面的普通话案例就是证明。
你生成的人设就是你拥有的人设。设计一次脸,配上固定的库内音色,它就能主持每一期节目——上面的绘本角色案例说明它甚至不必是照片级写实。
最难的部分你已经有了:音频。剪一段 35 秒以内的高光,配上一张人像,不用打开剪辑软件就得到一条社交平台可用的可视化短片。
口播视频与场景视频——每个模型需要你提供什么,又在这个工作台里交回什么。
| OmniHuman 1.5 | Seedance 2.5 | Veo 3.1 Pro | Kling 3.0 Turbo | |
|---|---|---|---|---|
| 你需要提供什么 | 1 张人像照片 + 你的音频,或输入文字并选一个库内音色 | 一段提示词,可选图像、视频和音频参考 | 一段提示词,可选参考图 | 一段提示词或一张起始图 |
| 谁在说这些话 | 你——虚拟形象对你的音轨逐字对口型 | 模型根据提示词生成配音 | 模型根据提示词生成配音 | 音频随短片一起生成 |
| 此处的片长 | 等于你的音频长度,最长 35 秒 | 4–30 秒 | 4–8 秒 | 3–15 秒 |
| 积分 | 每秒音频 130 积分 | 480p 每秒 110 · 720p 每秒 230 | 每条 320–1,920(4–8 秒 · 720p–4K · 含/不含音频) | 720p 每秒 55 · 1080p 每秒 70 |
| 本站实测 | 约 10 秒音频约需 4 分钟(7 条实测,2026 年 8 月) | 未在此任务上实测 | 未在此任务上实测 | 未在此任务上实测 |
积分、时长与输入选项读取自本工作台自己的模型注册表(2026 年 8 月 19 日)——描述的是你在这里能得到什么,而不是厂商公布的规格。耗时是我们对上方短片的实测;同样的脚本我们没有在另外三个模型上跑过,所以那些格子如实写明,而不是去猜。
将 OmniHuman 1.5 与其他视频模型进行比较——相同的工作区,一键切换。
| 模型 | omnihuman-1.5,字节跳动出品(研究论文发表于 2025 年 8 月) |
|---|---|
| 模式 | 会说话的数字人:一张照片 + 一条音轨 → 口播视频,就在本页的数字人工作台 |
| 输入 | 恰好 1 张人像,外加最长 35 秒的音频(上传 mp3/wav)——或输入最多 600 字符的文字合成语音 |
| 音色库 | 60 个内置音色覆盖 10 种语言:英语、中文、日语、韩语、法语、德语、西班牙语、意大利语、俄语、葡萄牙语 |
| 可选引导 | 一句简短的表演提示,描述动作、情绪和镜头——有用,但从不是必填 |
| 输出 | 一个保持你照片构图的连续镜头;片长等于音频长度。实测输出:2:3 照片得 1248×1664,16:9 得 1920×1088,25 fps,H.264 视频 + 单声道 AAC 音频 |
| 积分 | 每秒音频 130 积分、向上取整——最低 130,满 35 秒为 4,550;生成前会显示确切成本 |
| 实测速度 | 7 条实测中,被接受的任务约 10 秒音频耗时 3 分 20 秒–4 分 42 秒;有一条排队 14 分钟(2026 年 8 月,一个繁忙的周二晚上) |
上传一张清晰、正面、半身的人像——或者就在这个工作台用 GPT Image 2 或 Seedream 生成一张,本页所有人脸都是这么来的。一张照片一个人;让脸大而无遮挡。
上传一段音频(mp3 或 wav,最长 35 秒),或切换到文字模式:输入最多 600 个字符,从 10 种语言的 60 个音色中挑一个,每个都能先试听。
一句「平静、轻微点头、浅浅微笑」这样的短提示就能引导手势和情绪。留空的话,模型会自己读取音频的节奏与含义。
运行前会显示确切的积分成本——它随音频长度变化。生成是异步的;短片会连同全部输入一起进入历史记录,可用的配置下周还能原样复现。
一个账户,打通图像与视频生成全流程。
用免费额度的每日积分运行 OmniHuman 1.5,或升级以获得高级模型、更快生成与 4K 输出。
按年计费 · $240/year
字节跳动的音频驱动数字人模型。它接受一张人像照片和一条音轨,返回这个人说出这段音频的视频——嘴唇、表情、头部动作和手势都跟随声音。背后的研究论文发表于 2025 年 8 月。
能——这正是它和提示词驱动视频模型的区别。你提供音轨:上传 mp3/wav,或输入脚本并选择内置音色,虚拟形象会逐字对口型。提示词驱动的模型自己生成配音,很少能一字不差地说出你写的话。
不免费——按音频每秒 130 积分、向上取整计费,一条 10 秒短片就是 1,300 积分。生成前会显示确切成本,失败的运行会自动退款。脚本写紧凑、剪掉静音:音频的每一秒都是你要付费的一秒。
正面、半身、单人,脸要大、光要匀、无遮挡——评测者和我们自己的测试结论一致。上面那条故意做的四分之三侧脸测试展示了反例的下场:嘴唇几乎不动,模型还把头慢慢转得更远,桌上凭空多出了照片里没有的东西。生成的人像和相机拍的照片效果完全一样好。
可以——上面的绘本测试就是一张纯 2D 插画,OmniHuman 1.5 在保住画风的前提下把它演活了:眼睛、眉毛和嘴都像手绘动画角色一样动。我们观察到一个小怪癖:嘴张大时,模型给这张扁平插画画出了意外写实的牙齿。字节跳动的论文还宣称支持非人类主体;我们只测过这个插画角色。
本平台每条最多 35 秒音频——更长的脚本需要切分再拼接。在我们 2026 年 8 月的测试里,被接受的任务约 10 秒音频耗时 3 分 20 秒到 4 分 42 秒返回。同一晚的一个提醒:高负载时上游会先用容量报错拒绝几次提交才接单。被拒绝的运行不花钱,但高峰时段请把重试时间算进去,不要卡着五分钟后的死线。
首先是非正面的脸:我们的四分之三侧脸测试里嘴唇几乎不动,头还越转越远,桌上多出了照片里没有的东西。身份细节也可能在片中漂移——那条测试里耳环换了形状,另外两条里唇色比输入略深。多人对话在这里不可用,输出分辨率不高(我们的人像实测为 1248×1664,没有 4K),而且它只做口播视频:要动作、运镜或场景变化,请用 Seedance 2.5 或 Kling 3.0 Turbo。
你生成的视频可以在个人和商业项目中使用,须遵守我们的服务条款。脸才是要认真对待的部分:未经同意驱动真人照片可能侵犯肖像权与公开权,多个司法辖区现在还要求披露合成主持人。生成的脸——比如本页的每一张——完全绕开了授权问题。
OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.