Wan 3.0 AI 视频生成器

在浏览器中运行阿里巴巴的旗舰模型 Wan 3.0:片段最长 30 秒且自带音频;首尾帧模式可精确锁定镜头的起点和终点;参考模式可在一次请求中读取图片、视频和音频。

0 / 2,000
~400 cr

什么是 Wan 3.0?

Wan 3.0 即阿里巴巴的通义万相 3.0,是 Wan 2.7 的继任者,通过我们的视频服务商以 alibaba/wan-3.0 端点在此提供。三种模式共用一个面板:仅凭提示词的文生视频、固定首帧(可选再固定尾帧)的图生视频,以及在单次请求中读取最多 10 张图片、5 段视频片段和 5 条音轨的参考生视频,每个素材在提示词中按编号引用。它的标志性数字是范围:2 到 30 之间的任意整秒、从 480p 草稿档到 1080p 的三档分辨率,以及随每段视频一同生成的音频。

取舍是具体的。1080p 就是上限——要交付 4K 成片,请用 Kling 3.0。上游 API 定义了一种智能时长模式,由它自行决定片段长度;它会按 30 秒的上限预留积分,所以我们没有接入它——在这里你需要明确选择一个时长。参考视频的秒数也会计入计费,价格预览会在你提交之前显示这一点。本页下方那两个片段在这里生成分别用了 3m 33s(5 秒,720p)和 7m 32s(20 秒,720p)——对于长镜头,请按分钟而不是按秒来规划。

阿里巴巴的通义万相 3.0 可生成最长 30 秒、带原生音频的视频片段,锁定镜头的精确首帧和尾帧,并在一次参考请求中同时读取图片、视频片段和音轨——从 480p 经济档起按秒计费。

在本工作空间生成的一个真实 20 秒连续 Wan 3.0 镜头的画面

单次生成最长 30 秒

大多数 AI 视频模型止步于 10 秒或 15 秒;Wan 3.0 可以一次连续生成到 30 秒。这足以完成一段完整的产品演示、一场对白戏,或一组镜头序列,无需事后再拼接片段。可选 2 到 30 之间的任意整秒——按秒计费,因此 6 秒的草稿和 30 秒的成片价格严格成比例。

首尾帧视频插值示例

首尾帧控制

这里的图生视频不只是让一张照片动起来:上传首帧,可选再上传尾帧,Wan 3.0 会在你固定的两个端点之间插值出运动。它是本页下方对比中唯一接受尾帧的模型——区别在于"从这张图开始"和"恰好从这张图到恰好那张图"。

驱动 AI 视频生成的多模态参考素材

一次参考请求:图片、视频和音频混合提交

参考生视频在单次请求中接受混合素材——最多 10 张图片、5 段短视频片段和 5 条音轨——提示词按编号引用每一个:"图片 1 的角色,像视频 1 那样运动,配乐像音频 1"。参考图片和音频免费;参考视频的秒数会加进计费时长,费用在你生成之前就会显示。

在本工作空间生成的一个带原生大提琴音频的真实 Wan 3.0 片段的画面

原生音频与 480p 经济档

音频——人声、音效、环境声——随视频一同生成,关闭它也是同样的价格,所以声音永远没有附加费。三档分辨率按干净的比例计费:480p 每秒 40 积分用于草稿,720p 每秒 80,1080p 每秒 160 用于成片。在 480p 迭代、在 1080p 完成,能让 30 秒的制作保持可负担。

来自本工作空间的真实 Wan 3.0 片段

2026 年 8 月 26 日在此生成,一次成片,提示词和设置参数如实展示。那个 20 秒的片段是为了证明上文的长镜头说法——一次生成,没有剪辑,没有拼接。

提示词720p · 16:9 · 20s · 生成耗时 7m 32s

One continuous handheld shot following a food vendor through a night market: she ladles broth at her stall, hands a bowl to a customer, wipes the counter, then looks up smiling as lanterns sway overhead, ambient market chatter and sizzling sounds throughout, no cuts.

提示词720p · 16:9 · 5s · 生成耗时 3m 33s

A cellist practicing alone in a sunlit rehearsal room, bow moving across the strings, warm resonant cello notes filling the space, dust motes in the light, slow push-in.

Wan 3.0 适合谁

它是这一组中的长视频与精确控制模型:30 秒的时长上限、唯一的尾帧控制,以及最宽的参考素材工具箱。

  • 故事装不进 10 秒的人

    产品演示、对白场景和多节拍序列可以在一次生成中跑到 30 秒——无需拼接,片段之间没有连续性断层,音轨贯穿整个镜头。

  • 必须精确开始和结束在某个位置的镜头

    首尾帧模式接收两张图像,并在它们之间插值出运动——一次转变、一次揭示,或一个必须落在特定构图上的运镜。本页没有其他模型接受尾帧。

  • 用素材而不只是文字来执导的创作者

    把一张图里的角色、一段视频片段的运动风格和一条音轨喂给它,并在提示词里按编号分别引用。10 张图像、5 个片段和 5 条音轨可以塑造一次生成。

  • 低成本起稿,干净成片

    480p 档位按 1080p 费率的四分之一计费,提示词行为完全相同,因此你可以用 1,200 积分迭代一个 30 秒剪辑,只在确认无误后才以 4,800 渲染最终版。

  • 不适合:4K 最终交付,或不想手动指定片段时长

    1080p 是上限——4K 交付物属于 Kling 3.0。而且上游的智能时长模式没有接入这里,所以你总是必须在 2 到 30 秒之间选择一个明确时长。

Wan 3.0 与最接近它的视频模型对比

同一个工作区,同一个积分池——在这几个之间切换只要点一下。

Wan 3.0Wan 2.7MiniMax H3Kling 3.0
分辨率480p · 720p · 1080p720p · 1080p768p · 2K720p · 1080p · 4K
片段时长2–30s,任意整秒2–15 秒,任意整秒4–15 秒,任意整秒3–15 秒,任意整秒
计费方式按输出每秒计;参考视频秒数也计入按输出秒数计费按输出每秒计;参考视频秒数也计入按输出秒数计费
声音原生支持,默认开启——开与关费用相同原生自带,始终开启,没有开关原生自带,始终开启,没有开关可选开关,默认关闭
每秒积分,预算档480p 下 40未提供——720p 是下限768p 下 55720p 下 45,无声
每秒积分,1080p16070未提供——其最高档是 2K,计 90无声 60 · 带声音 85
6 秒 1080p 片子的积分9604201080p 下未提供无声 360 · 带声音 510
单条片子的积分,从最低到最高80–4,80080–1,050220–2,820135–3,000
图生视频首帧 + 可选尾帧仅首帧仅首帧仅首帧
参考素材最多 10 张图像 + 5 个视频 + 5 条音轨,引用为 Image 1 / Video 1 / Audio 1最多 5 张图像,引用为 Image 1, Image 2 …最多 9 张图像 + 3 个视频 + 3 条音轨没有——那唯一一张图就是首帧
宽高比5 种——16:9、9:16、1:1、4:3、3:45 种——16:9、9:16、1:1、4:3、3:46 — 16:9 到 21:93 种——16:9、9:16、1:1
我们自己测的速度5 秒用了 3m 33s,20 秒用了 7m 32s,均为 720p(2 个片段,2026 年 8 月)未实测未实测未实测

这张表里的每一个分辨率、片段时长和积分数字,都是 2026 年 8 月 26 日从我们自己的模型注册表和代码中的费率表里读取的——就是为你的生成计费所用的同一些表,而不是厂商的营销页面。全部四个模型都按秒计费,所以单片段的数字就是费率乘以你选择的时长;Wan 3.0 和 MiniMax H3 另外还会把参考视频的秒数计入计费。仅有的速度数字是我们自己生成并计时的那两个 Wan 3.0 片段;其余每个单元格都写着未实测(我们没有测过),而不是借用别人的数字。

更多类似 Wan 3.0 的视频模型

在同一工作区中将 Wan 3.0 与其他视频模型对比——一键切换。

CreateVision AI 上的 Wan 3.0 规格

模型wan-3.0(通义万相 3.0),由阿里巴巴推出——通过 alibaba/wan-3.0 端点提供服务
模式文生视频、带首尾帧控制的图生视频,以及可混合图像、视频和音频素材的参考生视频
分辨率480p、720p 和 1080p——按 1x / 2x / 4x 比例计费
时长2–30 秒,任意整秒(默认 5)——本平台最长的时长范围
宽高比文生视频和参考生视频支持 16:9、9:16、1:1、4:3 和 3:4;图生视频跟随首帧
参考素材最多 10 张图像、5 段视频片段(合计 15 秒)和 5 条音轨,在提示词中以 Image 1、Video 1、Audio 1 引用
首帧 / 末帧图生视频接受一个严格的首帧和一个可选的末帧;帧与参考素材在上游互斥
声音原生——人声、音效和环境音随片段一起生成;开启和关闭声音费用相同
积分按输出每秒计费:480p 为 40,720p 为 80,1080p 为 160——三种模式费率相同
参考视频计费参考视频秒数计入计费时长;参考图像和音频免费
单条片子的积分区间一段 2 秒 480p 片段为 80,一段 30 秒 1080p 片段最高 4,800(另加任何参考视频秒数)
取消失败的生成自动退款
实测速度一个 5 秒的 720p 片段用了 3m 33s,一个 20 秒的 720p 片段用了 7m 32s(2 个片段,2026 年 8 月 26 日)

如何使用 Wan 3.0

从空白提示词框到一段成片,只要三步。

开始生成视频
  1. 选择 Wan 3.0

    打开模型选择器并选择 Wan 3.0。在你花费任何额度之前,面板会显示其积分成本、分辨率选项和时长限制。

  2. 描述你想要的画面

    写清主体、动作,以及镜头怎么运动。想让片子从某张图开始,就附上首帧。

  3. 生成之后,继续往下做

    下载成片、延长它,或送去进一步编辑。提示词、模型与设置都会一同保存在你的历史记录里。

Wan 3.0 之外

一个账户,打通图像与视频生成全流程。

Wan 3.0 定价与免费每日积分

使用免费档位的每日积分运行 Wan 3.0,或升级以获得高级模型、更快的生成和 4K 输出。

免费版

$0

新手入门的理想之选

  • 200 欢迎积分,每日最多使用 80
  • Z Image Turbo 以 0 积分打稿
  • 标准生成速度
  • 包含生成历史记录
开始使用

高级版

最受欢迎
$29/month

按年计费 · $240/year

  • 每月 8,000 积分,无每日限额
  • 全部高级模型——GPT Image 2、Nano Banana、Seedream、Seedance、Veo、Kling
  • 5 倍生成速度,优先排队
  • AI 提示词增强
升级到 高级版

Ultimate

$49/month

按年计费 · $380/year

  • 每月 18,000 积分,无每日限额
  • 最高 4K 分辨率的高清生成
  • 优先支持
  • 最快的生成队列与新模型抢先体验
升级到 Ultimate

Wan 3.0——常见问题

1

Wan 3.0 最擅长什么?

长镜头和受控镜头:最长 30 秒、带原生音频的片段,一种首尾帧模式可精确锁定镜头的起点和终点,以及一种参考模式可在一次请求中同时读取图像、视频和音频。

2

Wan 3.0 在 CreateVision AI 上如何定价?

按输出每秒计费:480p 为 40 积分,720p 为 80,1080p 为 160——文生、图生和参考生视频费率相同。参考视频秒数计入计费时长;参考图像和音频免费。确切费用会在生成前显示,失败的运行自动退款。

3

Wan 3.0 支持哪些模式?

仅凭提示词的文生视频、来自首帧(含可选末帧)的图生视频,以及最多 10 张图像、5 段视频片段和 5 条音轨的参考生视频,在提示词中以 Image 1、Video 1、Audio 1 引用。

4

Wan 3.0 视频可以有多长?

2到30秒,任意整秒——这是本平台上所有视频模型中最长的时长范围。音频会随片段在任意时长下一起生成。

5

Wan 3.0 与 Wan 2.7 相比如何?

Wan 3.0 将时长上限翻倍(30s 对 15s),新增了 480p 经济档和尾帧控制,并将参考素材从 5 张图片扩展为图片+视频+音频混合素材。Wan 2.7 在 720p 下仍是更低价的选择(每秒 40 对 80 积分),适合较短的多镜头作品。

6

如果生成失败会怎样?

视频生成失败会自动退还积分——你只为成功完成的片段付费。

用 Wan 3.0 执导你的第一个 30 秒镜头

开始生成视频

探索我们的一键 AI 视频工具

生成前后的活儿都有一键工具——修饰、换风格、直接分享。

价格与使用方式 · 关键事实Wan 3.0

模型
Wan 3.0
开发方
Alibaba
使用方式
在 CreateVision AI 工作台内通过 API 直接运行——登录即可生成。无需 API 密钥,无需云项目,无需安装软件。
每次生成价格
每段 5 秒视频 200 积分起 ≈ $0.73(按 Premium 方案计算:$29/月,含 8,000 积分)。 免费方案每天包含 80 积分。
隐私
默认私密——任何方案下,其他用户都无法看到你的生成内容。我们不会出售或滥用会员数据。 隐私政策

最近更新Wan 3.0

  1. New

    Wan 3.0 (Alibaba Tongyi Wanxiang 3.0) integrated — clips up to 30 seconds with native audio, first-and-last-frame control, and reference-to-video that reads up to 10 images, 5 video clips and 5 audio tracks in one request. 480p/720p/1080p at 40/80/160 credits per second.