
单次生成最长 30 秒
大多数 AI 视频模型止步于 10 秒或 15 秒;Wan 3.0 可以一次连续生成到 30 秒。这足以完成一段完整的产品演示、一场对白戏,或一组镜头序列,无需事后再拼接片段。可选 2 到 30 之间的任意整秒——按秒计费,因此 6 秒的草稿和 30 秒的成片价格严格成比例。
在浏览器中运行阿里巴巴的旗舰模型 Wan 3.0:片段最长 30 秒且自带音频;首尾帧模式可精确锁定镜头的起点和终点;参考模式可在一次请求中读取图片、视频和音频。
Wan 3.0 即阿里巴巴的通义万相 3.0,是 Wan 2.7 的继任者,通过我们的视频服务商以 alibaba/wan-3.0 端点在此提供。三种模式共用一个面板:仅凭提示词的文生视频、固定首帧(可选再固定尾帧)的图生视频,以及在单次请求中读取最多 10 张图片、5 段视频片段和 5 条音轨的参考生视频,每个素材在提示词中按编号引用。它的标志性数字是范围:2 到 30 之间的任意整秒、从 480p 草稿档到 1080p 的三档分辨率,以及随每段视频一同生成的音频。
取舍是具体的。1080p 就是上限——要交付 4K 成片,请用 Kling 3.0。上游 API 定义了一种智能时长模式,由它自行决定片段长度;它会按 30 秒的上限预留积分,所以我们没有接入它——在这里你需要明确选择一个时长。参考视频的秒数也会计入计费,价格预览会在你提交之前显示这一点。本页下方那两个片段在这里生成分别用了 3m 33s(5 秒,720p)和 7m 32s(20 秒,720p)——对于长镜头,请按分钟而不是按秒来规划。
阿里巴巴的通义万相 3.0 可生成最长 30 秒、带原生音频的视频片段,锁定镜头的精确首帧和尾帧,并在一次参考请求中同时读取图片、视频片段和音轨——从 480p 经济档起按秒计费。

大多数 AI 视频模型止步于 10 秒或 15 秒;Wan 3.0 可以一次连续生成到 30 秒。这足以完成一段完整的产品演示、一场对白戏,或一组镜头序列,无需事后再拼接片段。可选 2 到 30 之间的任意整秒——按秒计费,因此 6 秒的草稿和 30 秒的成片价格严格成比例。

这里的图生视频不只是让一张照片动起来:上传首帧,可选再上传尾帧,Wan 3.0 会在你固定的两个端点之间插值出运动。它是本页下方对比中唯一接受尾帧的模型——区别在于"从这张图开始"和"恰好从这张图到恰好那张图"。

参考生视频在单次请求中接受混合素材——最多 10 张图片、5 段短视频片段和 5 条音轨——提示词按编号引用每一个:"图片 1 的角色,像视频 1 那样运动,配乐像音频 1"。参考图片和音频免费;参考视频的秒数会加进计费时长,费用在你生成之前就会显示。

音频——人声、音效、环境声——随视频一同生成,关闭它也是同样的价格,所以声音永远没有附加费。三档分辨率按干净的比例计费:480p 每秒 40 积分用于草稿,720p 每秒 80,1080p 每秒 160 用于成片。在 480p 迭代、在 1080p 完成,能让 30 秒的制作保持可负担。
2026 年 8 月 26 日在此生成,一次成片,提示词和设置参数如实展示。那个 20 秒的片段是为了证明上文的长镜头说法——一次生成,没有剪辑,没有拼接。
One continuous handheld shot following a food vendor through a night market: she ladles broth at her stall, hands a bowl to a customer, wipes the counter, then looks up smiling as lanterns sway overhead, ambient market chatter and sizzling sounds throughout, no cuts.
A cellist practicing alone in a sunlit rehearsal room, bow moving across the strings, warm resonant cello notes filling the space, dust motes in the light, slow push-in.
它是这一组中的长视频与精确控制模型:30 秒的时长上限、唯一的尾帧控制,以及最宽的参考素材工具箱。
产品演示、对白场景和多节拍序列可以在一次生成中跑到 30 秒——无需拼接,片段之间没有连续性断层,音轨贯穿整个镜头。
首尾帧模式接收两张图像,并在它们之间插值出运动——一次转变、一次揭示,或一个必须落在特定构图上的运镜。本页没有其他模型接受尾帧。
把一张图里的角色、一段视频片段的运动风格和一条音轨喂给它,并在提示词里按编号分别引用。10 张图像、5 个片段和 5 条音轨可以塑造一次生成。
480p 档位按 1080p 费率的四分之一计费,提示词行为完全相同,因此你可以用 1,200 积分迭代一个 30 秒剪辑,只在确认无误后才以 4,800 渲染最终版。
1080p 是上限——4K 交付物属于 Kling 3.0。而且上游的智能时长模式没有接入这里,所以你总是必须在 2 到 30 秒之间选择一个明确时长。
同一个工作区,同一个积分池——在这几个之间切换只要点一下。
| Wan 3.0 | Wan 2.7 | MiniMax H3 | Kling 3.0 | |
|---|---|---|---|---|
| 分辨率 | 480p · 720p · 1080p | 720p · 1080p | 768p · 2K | 720p · 1080p · 4K |
| 片段时长 | 2–30s,任意整秒 | 2–15 秒,任意整秒 | 4–15 秒,任意整秒 | 3–15 秒,任意整秒 |
| 计费方式 | 按输出每秒计;参考视频秒数也计入 | 按输出秒数计费 | 按输出每秒计;参考视频秒数也计入 | 按输出秒数计费 |
| 声音 | 原生支持,默认开启——开与关费用相同 | 原生自带,始终开启,没有开关 | 原生自带,始终开启,没有开关 | 可选开关,默认关闭 |
| 每秒积分,预算档 | 480p 下 40 | 未提供——720p 是下限 | 768p 下 55 | 720p 下 45,无声 |
| 每秒积分,1080p | 160 | 70 | 未提供——其最高档是 2K,计 90 | 无声 60 · 带声音 85 |
| 6 秒 1080p 片子的积分 | 960 | 420 | 1080p 下未提供 | 无声 360 · 带声音 510 |
| 单条片子的积分,从最低到最高 | 80–4,800 | 80–1,050 | 220–2,820 | 135–3,000 |
| 图生视频 | 首帧 + 可选尾帧 | 仅首帧 | 仅首帧 | 仅首帧 |
| 参考素材 | 最多 10 张图像 + 5 个视频 + 5 条音轨,引用为 Image 1 / Video 1 / Audio 1 | 最多 5 张图像,引用为 Image 1, Image 2 … | 最多 9 张图像 + 3 个视频 + 3 条音轨 | 没有——那唯一一张图就是首帧 |
| 宽高比 | 5 种——16:9、9:16、1:1、4:3、3:4 | 5 种——16:9、9:16、1:1、4:3、3:4 | 6 — 16:9 到 21:9 | 3 种——16:9、9:16、1:1 |
| 我们自己测的速度 | 5 秒用了 3m 33s,20 秒用了 7m 32s,均为 720p(2 个片段,2026 年 8 月) | 未实测 | 未实测 | 未实测 |
这张表里的每一个分辨率、片段时长和积分数字,都是 2026 年 8 月 26 日从我们自己的模型注册表和代码中的费率表里读取的——就是为你的生成计费所用的同一些表,而不是厂商的营销页面。全部四个模型都按秒计费,所以单片段的数字就是费率乘以你选择的时长;Wan 3.0 和 MiniMax H3 另外还会把参考视频的秒数计入计费。仅有的速度数字是我们自己生成并计时的那两个 Wan 3.0 片段;其余每个单元格都写着未实测(我们没有测过),而不是借用别人的数字。
在同一工作区中将 Wan 3.0 与其他视频模型对比——一键切换。
| 模型 | wan-3.0(通义万相 3.0),由阿里巴巴推出——通过 alibaba/wan-3.0 端点提供服务 |
|---|---|
| 模式 | 文生视频、带首尾帧控制的图生视频,以及可混合图像、视频和音频素材的参考生视频 |
| 分辨率 | 480p、720p 和 1080p——按 1x / 2x / 4x 比例计费 |
| 时长 | 2–30 秒,任意整秒(默认 5)——本平台最长的时长范围 |
| 宽高比 | 文生视频和参考生视频支持 16:9、9:16、1:1、4:3 和 3:4;图生视频跟随首帧 |
| 参考素材 | 最多 10 张图像、5 段视频片段(合计 15 秒)和 5 条音轨,在提示词中以 Image 1、Video 1、Audio 1 引用 |
| 首帧 / 末帧 | 图生视频接受一个严格的首帧和一个可选的末帧;帧与参考素材在上游互斥 |
| 声音 | 原生——人声、音效和环境音随片段一起生成;开启和关闭声音费用相同 |
| 积分 | 按输出每秒计费:480p 为 40,720p 为 80,1080p 为 160——三种模式费率相同 |
| 参考视频计费 | 参考视频秒数计入计费时长;参考图像和音频免费 |
| 单条片子的积分区间 | 一段 2 秒 480p 片段为 80,一段 30 秒 1080p 片段最高 4,800(另加任何参考视频秒数) |
| 取消 | 失败的生成自动退款 |
| 实测速度 | 一个 5 秒的 720p 片段用了 3m 33s,一个 20 秒的 720p 片段用了 7m 32s(2 个片段,2026 年 8 月 26 日) |
打开模型选择器并选择 Wan 3.0。在你花费任何额度之前,面板会显示其积分成本、分辨率选项和时长限制。
写清主体、动作,以及镜头怎么运动。想让片子从某张图开始,就附上首帧。
下载成片、延长它,或送去进一步编辑。提示词、模型与设置都会一同保存在你的历史记录里。
一个账户,打通图像与视频生成全流程。
使用免费档位的每日积分运行 Wan 3.0,或升级以获得高级模型、更快的生成和 4K 输出。
按年计费 · $240/year
长镜头和受控镜头:最长 30 秒、带原生音频的片段,一种首尾帧模式可精确锁定镜头的起点和终点,以及一种参考模式可在一次请求中同时读取图像、视频和音频。
按输出每秒计费:480p 为 40 积分,720p 为 80,1080p 为 160——文生、图生和参考生视频费率相同。参考视频秒数计入计费时长;参考图像和音频免费。确切费用会在生成前显示,失败的运行自动退款。
仅凭提示词的文生视频、来自首帧(含可选末帧)的图生视频,以及最多 10 张图像、5 段视频片段和 5 条音轨的参考生视频,在提示词中以 Image 1、Video 1、Audio 1 引用。
2到30秒,任意整秒——这是本平台上所有视频模型中最长的时长范围。音频会随片段在任意时长下一起生成。
Wan 3.0 将时长上限翻倍(30s 对 15s),新增了 480p 经济档和尾帧控制,并将参考素材从 5 张图片扩展为图片+视频+音频混合素材。Wan 2.7 在 720p 下仍是更低价的选择(每秒 40 对 80 积分),适合较短的多镜头作品。
视频生成失败会自动退还积分——你只为成功完成的片段付费。
生成前后的活儿都有一键工具——修饰、换风格、直接分享。
Wan 3.0 (Alibaba Tongyi Wanxiang 3.0) integrated — clips up to 30 seconds with native audio, first-and-last-frame control, and reference-to-video that reads up to 10 images, 5 video clips and 5 audio tracks in one request. 480p/720p/1080p at 40/80/160 credits per second.