
原生音频,无需配音流程
HappyHorse 在同一次生成中同时产出音轨与画面,对白、环境声和音效天然与屏幕内容对齐。无需单独的音频步骤,无需手动对轨——成片即刻可发。
在 HappyHorse 1.1 上,声音不是一个选项:画面、音频和口型出自同一趟生成,会说话的角色出来时嘴就已经对上了。
HappyHorse 1.1 是我们通过 alibaba/happyhorse-1.1 这个接口调用的第三方视频模型——不是我们训练的,也不是我们托管的。它在这里的不同之处是声音不是可选项:音频和口型和画面在同一趟里一起生成,所以一个会说话的角色出来时嘴就已经对上了,不用再补一道配音。三种模式共用一个面板——文生视频、图生视频,以及吃一到九张图的参考生视频。
先知道边界。它两档分辨率的每秒单价都比 Wan 2.7 高,所以镜头先去更便宜的地方找出来,选中的那条再拿到这里重渲。音频关不掉,也就没有一条干净的无声底片留给你自己配乐,而且 1080p 就是天花板。六语言口型同步这个数字是模型自己文档里的说法——我们没有逐个语言测过——下面这些片子我们也没有计时,所以这一页不给任何速度结论。
Alibaba 排名领先的视频模型可同时生成画面与声音,支持六种语言的帧级精准唇形同步、逼真的物理效果,以及最多九张参考图保持角色一致。

HappyHorse 在同一次生成中同时产出音轨与画面,对白、环境声和音效天然与屏幕内容对齐。无需单独的音频步骤,无需手动对轨——成片即刻可发。

说话的角色在英语、普通话、日语、韩语、德语和法语中都能精准对口型。把台词写进提示词,模型就会处理帧级精准的口型——非常适合旁白短片和多语言社交内容。

参考图生视频模式最多接受九张图片,按 character1、character2 的顺序引用——无需任何微调,即可让人脸、服装和道具在整段片段中保持一致。

在独立视频排行榜上名列前茅的模型之一:布料拖曳、水面激荡、物体呈现可信的重量感。可选 720p 或 1080p、3-15 秒,以及从竖屏 9:16 到超宽 21:9 的九种画幅比例。
2026 年 8 月 15 日在这里生成,一次出片,提示词与参数原样展示。每段片子对应本页下方所主张的某一项能力。
A news presenter at a desk speaking directly to camera, clear mouth movement matching speech, studio lighting, static medium shot.
A barista explaining a pour-over to a customer across the counter, gesturing at the kettle, warm cafe ambience, medium two-shot.
在这组模型里,它是把声音当作镜头的一部分、而不是事后添加物的那一个——价格也是照这个来的。
对白、口型和画面出自同一次生成,所以主持人、代言人或有台词的角色拿到手时就已经同步了。剪辑里不用对齐任何东西,也不用再单独委托一道配音。
参考图生视频最多收九张图,你在提示词里以 character1、character2 等指代它们。这些位子足够放下一个小演员阵容,外加那些必须保持一致的道具和服装。
九种画面比例,其中 4:5 和 5:4 用于信息流帖子,两端还有 21:9 和 9:21,所以构图是在生成时定下来的,而不是把一个按别的形状构好图的东西裁出来。
音频每次都和画面一起生成,所以回来的东西原样就能发。当交付物是一条带人声的短片、而截止时间就是今天时,这确实省时间。
两个分辨率下它的每秒费率都高于 Wan 2.7,所以去更便宜的地方迭代,再把选中的那条拿到这里重新渲染。音频关不掉,所以没有干净的无声底片供你自己配乐;1080p 是上限——要 4K 成片,那是 Kling 3.0 的活。
同一个工作区,同一个积分池——在这几个之间切换只要点一下。
| HappyHorse 1.1 | Wan 2.7 | Hailuo 02 | Kling 3.0 | |
|---|---|---|---|---|
| 分辨率 | 720p · 1080p | 720p · 1080p | 512p · 768p · 1080p | 720p · 1080p · 4K |
| 片段时长 | 3–15 秒,任意整秒 | 2–15 秒,任意整秒 | 6 或 10 秒——1080p 只有 6 秒 | 3–15 秒,任意整秒 |
| 计费方式 | 按输出秒数计费 | 按输出秒数计费 | 按成片计价,取自一张固定的五条目费率表 | 按输出秒数计费 |
| 声音 | 原生音频和口型同步,始终开启,没有开关 | 原生自带,始终开启,没有开关 | 没有音频参数——出来的片子是无声的 | 可选开关,默认关闭 |
| 每秒积分,720p | 65 | 40 | 不适用——按成片计价,而且它最接近的档位是 768p | 无声 45 · 带声音 60 |
| 每秒积分,1080p | 85 | 70 | 不适用——按成片计价 | 无声 60 · 带声音 85 |
| 每秒积分,4K | 没有这一档 | 没有这一档 | 没有这一档 | 200,含声音,不额外收费 |
| 6 秒 1080p 片子的积分 | 510 | 420 | 240 | 无声 360 · 带声音 510 |
| 单条片子的积分,从最低到最高 | 195–1,275 | 80–1,050 | 40–240 | 135–3,000 |
| 图生视频 | 支持,一张首帧 | 支持,一张首帧 | 支持,一张首帧 | 支持,一张首帧 |
| 用于保持身份的参考图 | 最多 9 张,在提示词里以 character1、character2 …… 指代 | 最多 5 张,在提示词里以 Image 1、Image 2 …… 指代 | 没有——不提供参考图生视频模式 | 没有——那唯一一张图就是首帧 |
| 宽高比 | 9 种——从 9:21 一直到 21:9 | 5 种——16:9、9:16、1:1、4:3、3:4 | 没有画面比例参数 | 3 种——16:9、9:16、1:1 |
| 我们自己测的速度 | 未实测 | 未实测 | 两条 768p 6 秒片子分别为 94s 和 86s(2 条,2026 年 8 月) | 未实测 |
本表中的每一个分辨率、片长和积分数字,都是 2026 年 8 月 20 日从我们自己的模型注册表和代码里的费率表读出来的——就是给你的生成计价的那几张表,不是厂商的营销页。HappyHorse 1.1、Wan 2.7 和 Kling 3.0 按秒计费,所以它们的单条片子数字是费率乘以你选的片长;Hailuo 02 按成片计费,取自一张固定的表。这里唯一的速度数字来自我们自己计时的那两条 Hailuo 02 片子,我们没测过的每一个格子都会直说,而不是从别处借一个数字来填。
对比 HappyHorse 1.1 与其他视频模型——同一工作台,一键切换。
| 模型 | happyhorse-1.1——第三方模型,通过我们的视频供应商以 alibaba/happyhorse-1.1 端点提供 |
|---|---|
| 模式 | 文生视频、以恰好一张首帧出发的图生视频,以及带 1–9 张参考图的参考图生视频 |
| 分辨率 | 720p 和 1080p |
| 时长 | 3–15 秒,任意整秒(默认 5 秒) |
| 宽高比 | 九种——16:9、9:16、1:1、4:3、3:4、4:5、5:4、21:9 和 9:21——适用于文生视频和参考图生视频;图生视频跟随参考照片 |
| 参考图 | 最多 9 张,在提示词里按顺序以 character1、character2 等指代。只收图片——参考视频和参考音频不是输入项 |
| 声音 | 原生音频和口型同步在同一次生成中产出,始终开启——没有开关,也没有无声选项 |
| 口型同步语言 | 六种,按模型自己的文档:英语、普通话、日语、韩语、德语和法语。这几种我们都没在这里逐一测过 |
| 积分 | 按输出秒数计:720p 65,1080p 85——文生视频、图生视频和参考图生视频同一费率 |
| 单条片子的积分区间 | 3 秒 720p 的片子 195,15 秒 1080p 的片子最高 1,275 |
| 实测速度 | 我们没测过——本页上那两条片子是在这里生成的,但我们没记录它们的生成时间 |
从空白提示词框到一段成片,只要三步。
打开模型选择器,选择 HappyHorse 1.1。在你花掉任何积分之前,面板就会显示它的积分费用、分辨率选项与时长上限。
写清主体、动作,以及镜头怎么运动。想让片子从某张图开始,就附上首帧。
下载成片、延长它,或送去进一步编辑。提示词、模型与设置都会一同保存在你的历史记录里。
一个账户,打通图像与视频生成全流程。
用免费额度的每日积分运行 HappyHorse 1.1,或升级以获得高级模型、更快生成与 4K 输出。
按年计费 · $240/year
它在一次生成中同时产出视频与同步音频,并支持六种语言的帧级精准唇形同步。独立排行榜将其列为当前顶尖视频模型之一。
按输出秒数计费:费率取决于分辨率(720p 或 1080p),文生、图生和参考图生视频统一费率。每次生成前都会显示确切费用,失败的生成自动退款。
支持文生视频、图生视频(让首帧动起来),以及最多 9 张参考图的参考图生视频,按 character1、character2 的顺序引用。
每次生成 3-15 秒,支持 720p 或 1080p,始终包含原生音频。
英语、普通话、日语、韩语、德语和法语——把台词写进提示词,口型就会随之而动。
视频生成失败时积分自动退还。
生成前后的活儿都有一键工具——修饰、换风格、直接分享。