Wan 3.0

Write a scene and Wan 3.0 films it, sound included.

0/5000
5s · 18 credits / s
2s30s
Audio
Dialogue, effects and music in the same pass · same price

Wan 3.0

Example

Wan 3.0 AI 视频生成器(阿里万相 3.0)

阿里最新 Wan 3.0 模型支持单次长镜头一镜到底生成长达 30 秒视频,对白、音效与配乐与画面原生同步生成。支持纯文本提示词、单张照片或混合图像、视频片段与音频素材全能参考驱动。

Wan 3.0 作品展示

本页面真实输出效果,未经后期剪辑。每张卡片完整展示输入参数与提示词。

文生视频720P · 8秒 · 16:9 · 开启音频

提示词: 一个连续跟拍的长镜头,穿过雨夜湿漉漉的香港夜市。镜头滑过热气腾腾的面摊和倒映在水洼中的霓虹灯牌,最后定格在一位街头摊主身上,他抬起头说:“今晚最后一碗了。” 电影级光影,浅景深,伴随淅淅沥沥的雨声与炒锅爆炒声。

图生视频720P · 5秒 · 首帧控制 · 开启音频

提示词: 主体缓缓转头望向镜头并露出微笑,微风吹拂发丝,镜头轻柔推近,伴有自然的环境声。

输入图像输入图像
参考生视频480P · 3秒 · 9:16 · 单张参考图

提示词: 图像 1(Image 1)在黄昏黄金时段沿着阳光明媚的海滩漫步,浪花翻滚涌来,手持摄影风格。

输入图像输入图像

Wan 3.0 核心能力

单一全能模型涵盖文生视频、图生视频与参考生视频,每种模式均共享相同的时长、分辨率与音频控制能力。

30 秒一镜到底

支持 2 至 30 秒任意时长。单次连续推理生成,全程保持运镜流畅与主体角色稳定,告别碎片化短视频拼接。

音画同轨原生生成

对白、环境音、音效与背景音乐与画面同步生成,口型动作与脚步声精准对齐。台词只需加上双引号即可配音。

全模态参考控制

单次请求最多支持融合 10 张图像、5 段视频与 5 段音频。面部轮廓、商品外观、声音声线与艺术风格全程高度一致。

首尾帧精准控制

上传首帧即可驱动静态照片生成生动视频,添加尾帧更能精准指定镜头最终定格画面。

480P 至 1080P 多档可选

用 480P 超低成本快速打样,确认效果后再以 720P 或 1080P 高清渲染成片。支持 16:9、9:16、4:3、3:4、1:1 或让模型智能裁切构图。

清晰可辨的屏幕文本

路牌标语、商品包装标签与文字字幕渲染清晰锐利,完美满足商品展示、菜单与解说视频需求。

Wan 3.0 计费说明

按生成的视频秒数计费,音频生成无需额外费用。

分辨率每秒资费5 秒片段10 秒片段30 秒片段
480P9 点数45 点数90 点数270 点数
720P18 点数90 点数180 点数540 点数
1080P36 点数180 点数360 点数1080 点数

参考图像与参考音频完全免费。每秒参考视频按输出视频同等费率计费。若生成失败,消耗的点数将自动全额原路退还。

如何使用 Wan 3.0 制作视频

  1. 1

    选择创作模式

    文生视频从文字描述起步;图生视频驱动首帧(可加尾帧);参考生视频支持融合图像、视频和音频。

  2. 2

    描述镜头画面

    描述登场主体、动作事件、运镜轨迹以及需要听到的声音。在参考模式中,请将素材命名为图像 1(Image 1)、视频 1(Video 1)、音频 1(Audio 1)。

  3. 3

    设定时长与分辨率

    选择 2 到 30 秒时长以及 480P、720P 或 1080P。按钮上会实时显示所需点数。多数视频在 1 到 5 分钟内完成并自动保存至【我的视频】。

提示词编写技巧

按连续长镜头构思

Wan 3.0 最擅长处理一气呵成的运镜描述:明确镜头的起始位置、途中经过的景物以及最终定格之处。

对白加上引号

带引号的台词会被角色在画面中自然说出。同时可加入你想听到的环境音,如雨声、车流声或喧闹人群。

规范引用素材编号

按上传顺序对各类型素材编号,例如:“图像 2(Image 2)拿着图像 1(Image 1)中的商品,背景播放音频 1(Audio 1)的声音。”

先用 480P 快速打样

480P 成本仅为 1080P 的四分之一。先用低成本短片段锁定构思,确认满意后再全部分辨率渲染最终成片。

Wan 3.0 常见问题

Have a different question and can't find the answer you're looking for? Reach out to our support team by sending us an email and we'll get back to you as soon as we can.

什么是 Wan 3.0?

Wan 3.0 是阿里巴巴通义万相团队推出的最新一代旗舰视频生成大模型,于 2026 年 8 月开启公测。单一模型即可处理文生视频、图生视频与参考生视频,单次最高支持生成 30 秒 1080P 高清视频,并在单次生成中原生同步输出音轨。

Wan 3.0 支持生成多长时间的视频?

支持 2 到 30 秒之间的任意整数秒。当上传参考视频时,参考视频的总时长加上输出视频时长不得超过 30 秒,时长滑块会自动调整上限。

Wan 3.0 的收费标准是怎样的?

按视频秒数计费:480P 为每秒 9 点数,720P 为每秒 18 点数,1080P 为每秒 36 点数。例如一段 5 秒 720P 片段需要 90 点数。开启或关闭音频价格相同。参考图像与参考音频免费;参考视频秒数按输出视频相同单价计费。

支持哪些文件作为参考素材?

最多支持 10 张图像(JPG、PNG、WEBP)、5 段视频(MP4、MOV)与 5 段音频(MP3、WAV)。每个片段时长为 1 到 15 秒,每种类型总时长上限为 15 秒。在提示词中直接引用为图像 1、视频 1、音频 1(或英文 Image 1、Video 1、Audio 1)即可。

我可以控制视频的首尾帧吗?

可以。在图生视频模式下,上传首帧即可让静态画面动起来;还可选择添加尾帧,精准控制镜头动作的定格终点。生成视频将自动保持首帧的画面比例。

可以关闭音频生成吗?

可以。关闭【音频】开关即可生成纯静音视频,开启或关闭的点数消耗相同。

支持哪些画面比例?

支持 16:9、9:16、4:3、3:4 和 1:1。参考生视频模式还提供【自动(Auto)】选项,由模型根据参考素材智能决定构图;图生视频模式则默认遵循首帧比例。

Wan 3.0 与 Wan 2.6 有什么区别?

Wan 3.0 将单次最长生成时间翻倍至 30 秒,新增了高性价比的 480P 打样档位和自适应画面比例,支持首尾帧双向锚定,并全面支持视频与音频作为多模态参考输入。

生成视频需要多长时间?

通常为 1 到 5 分钟;30 秒 1080P 视频耗时会略长。提交后可离开页面,生成完成的视频将自动出现在【我的视频】中。

如果生成失败会扣除点数吗?

不会。失败任务消耗的点数将自动全额退还至你的账户余额,你可以立即修改提示词重新尝试。