Write a scene and Wan 3.0 films it, sound included.
Wan 3.0
阿里最新 Wan 3.0 模型支持单次长镜头一镜到底生成长达 30 秒视频,对白、音效与配乐与画面原生同步生成。支持纯文本提示词、单张照片或混合图像、视频片段与音频素材全能参考驱动。
本页面真实输出效果,未经后期剪辑。每张卡片完整展示输入参数与提示词。
提示词: 一个连续跟拍的长镜头,穿过雨夜湿漉漉的香港夜市。镜头滑过热气腾腾的面摊和倒映在水洼中的霓虹灯牌,最后定格在一位街头摊主身上,他抬起头说:“今晚最后一碗了。” 电影级光影,浅景深,伴随淅淅沥沥的雨声与炒锅爆炒声。
提示词: 主体缓缓转头望向镜头并露出微笑,微风吹拂发丝,镜头轻柔推近,伴有自然的环境声。
输入图像提示词: 图像 1(Image 1)在黄昏黄金时段沿着阳光明媚的海滩漫步,浪花翻滚涌来,手持摄影风格。
输入图像单一全能模型涵盖文生视频、图生视频与参考生视频,每种模式均共享相同的时长、分辨率与音频控制能力。
支持 2 至 30 秒任意时长。单次连续推理生成,全程保持运镜流畅与主体角色稳定,告别碎片化短视频拼接。
对白、环境音、音效与背景音乐与画面同步生成,口型动作与脚步声精准对齐。台词只需加上双引号即可配音。
单次请求最多支持融合 10 张图像、5 段视频与 5 段音频。面部轮廓、商品外观、声音声线与艺术风格全程高度一致。
上传首帧即可驱动静态照片生成生动视频,添加尾帧更能精准指定镜头最终定格画面。
用 480P 超低成本快速打样,确认效果后再以 720P 或 1080P 高清渲染成片。支持 16:9、9:16、4:3、3:4、1:1 或让模型智能裁切构图。
路牌标语、商品包装标签与文字字幕渲染清晰锐利,完美满足商品展示、菜单与解说视频需求。
按生成的视频秒数计费,音频生成无需额外费用。
| 分辨率 | 每秒资费 | 5 秒片段 | 10 秒片段 | 30 秒片段 |
|---|---|---|---|---|
| 480P | 9 点数 | 45 点数 | 90 点数 | 270 点数 |
| 720P | 18 点数 | 90 点数 | 180 点数 | 540 点数 |
| 1080P | 36 点数 | 180 点数 | 360 点数 | 1080 点数 |
参考图像与参考音频完全免费。每秒参考视频按输出视频同等费率计费。若生成失败,消耗的点数将自动全额原路退还。
文生视频从文字描述起步;图生视频驱动首帧(可加尾帧);参考生视频支持融合图像、视频和音频。
描述登场主体、动作事件、运镜轨迹以及需要听到的声音。在参考模式中,请将素材命名为图像 1(Image 1)、视频 1(Video 1)、音频 1(Audio 1)。
选择 2 到 30 秒时长以及 480P、720P 或 1080P。按钮上会实时显示所需点数。多数视频在 1 到 5 分钟内完成并自动保存至【我的视频】。
Wan 3.0 最擅长处理一气呵成的运镜描述:明确镜头的起始位置、途中经过的景物以及最终定格之处。
带引号的台词会被角色在画面中自然说出。同时可加入你想听到的环境音,如雨声、车流声或喧闹人群。
按上传顺序对各类型素材编号,例如:“图像 2(Image 2)拿着图像 1(Image 1)中的商品,背景播放音频 1(Audio 1)的声音。”
480P 成本仅为 1080P 的四分之一。先用低成本短片段锁定构思,确认满意后再全部分辨率渲染最终成片。
Have a different question and can't find the answer you're looking for? Reach out to our support team by sending us an email and we'll get back to you as soon as we can.
Wan 3.0 是阿里巴巴通义万相团队推出的最新一代旗舰视频生成大模型,于 2026 年 8 月开启公测。单一模型即可处理文生视频、图生视频与参考生视频,单次最高支持生成 30 秒 1080P 高清视频,并在单次生成中原生同步输出音轨。
支持 2 到 30 秒之间的任意整数秒。当上传参考视频时,参考视频的总时长加上输出视频时长不得超过 30 秒,时长滑块会自动调整上限。
按视频秒数计费:480P 为每秒 9 点数,720P 为每秒 18 点数,1080P 为每秒 36 点数。例如一段 5 秒 720P 片段需要 90 点数。开启或关闭音频价格相同。参考图像与参考音频免费;参考视频秒数按输出视频相同单价计费。
最多支持 10 张图像(JPG、PNG、WEBP)、5 段视频(MP4、MOV)与 5 段音频(MP3、WAV)。每个片段时长为 1 到 15 秒,每种类型总时长上限为 15 秒。在提示词中直接引用为图像 1、视频 1、音频 1(或英文 Image 1、Video 1、Audio 1)即可。
可以。在图生视频模式下,上传首帧即可让静态画面动起来;还可选择添加尾帧,精准控制镜头动作的定格终点。生成视频将自动保持首帧的画面比例。
可以。关闭【音频】开关即可生成纯静音视频,开启或关闭的点数消耗相同。
支持 16:9、9:16、4:3、3:4 和 1:1。参考生视频模式还提供【自动(Auto)】选项,由模型根据参考素材智能决定构图;图生视频模式则默认遵循首帧比例。
Wan 3.0 将单次最长生成时间翻倍至 30 秒,新增了高性价比的 480P 打样档位和自适应画面比例,支持首尾帧双向锚定,并全面支持视频与音频作为多模态参考输入。
通常为 1 到 5 分钟;30 秒 1080P 视频耗时会略长。提交后可离开页面,生成完成的视频将自动出现在【我的视频】中。
不会。失败任务消耗的点数将自动全额退还至你的账户余额,你可以立即修改提示词重新尝试。