Put two faces into the orange-booth duet. The moves, framing and sound stay exactly as in the template.
Left performer
Right performer
Best results: a sharp, front-facing photo with the whole face visible and no sunglasses. Only upload people who agreed to it.
15s with the original sound. Wan 3.0 bills the 15s template plus the 15s it renders.
Hotel Lobby AI
一键将两张面孔置入全网爆火的橙色录音间双人对唱模板中。每人只需上传一张照片,Wan 3.0 即可将面孔精准替换进模板:原版的一举一动、镜头角度与标志性节奏原声完美保留。
真实特效生成效果,无任何人工后期干预。


为每位主角上传一张清晰的正面面部照片。图像 1 位于麦克风左侧,图像 2 位于右侧。点击交换按钮可一键调换左右位置。
模板、提示词与模型参数已深度优化配置。Wan 3.0 会完整保留原版录音间、律动动作与原声,仅替换两位主角面孔。
15 秒完整音画对唱视频将实时呈现在预览区并保存至【我的视频】,直接适配 TikTok、Instagram Reels 或 YouTube Shorts 发布。
它是对真实表演的精准重绘,而非凭空虚构动作。
Wan 3.0 将模板片段作为视频参考进行深度解析,手部手势、律动点头、唇形动作与节拍节奏均直接继承自原版表演。
每张照片严格绑定对应的一名演唱者,整段视频中绝不发生面部混淆或中途位置对调。
完整保留对唱原声伴奏与音频,成片即刻可发,无需打开剪辑软件重新配乐。
换脸算法与运镜提示词已专为此模板量身调校,你只需挑选录音间里的登场主角。
正面或微侧脸、双眼清晰可见最佳。墨镜、口罩或手部遮挡面部会降低相似度。
请裁掉背景中的其他人,以便模型精准识别并提取目标面部特征。
自然日光或明亮的室内光线效果最好。模糊或过度磨皮美颜的自拍生成效果偏软。
闺蜜好友、情侣搭档、你和老爸,甚至是同一人不同造型分饰两角——意想不到的组合最容易引爆点赞!
Wan 3.0 会读取 15 秒模板并渲染 15 秒输出,720P 高清模式下每秒收费 18 点数。标准 480P 模式仅需 270 点数。生成失败自动全额退款。
想创作更多自定义场景?立即体验 Wan 3.0Have a different question and can't find the answer you're looking for? Reach out to our support team by sending us an email and we'll get back to you as soon as we can.
这是源自橙色复古录音间悬挂麦克风说唱对唱的爆火网络视频形式。创作者们将画面中的两位表演者换成好友、情侣、家人或自己分饰两角,并分享至 TikTok、Reels 和 Shorts 等短视频平台。
该特效将原版模板片段作为视频参考连同你上传的两张照片一同输入给 Wan 3.0 模型。模型在严格保留原视频动作、构图运镜与原声音轨的同时,高保真重绘两位主角的面容表情。
生成 15 秒 720P 带声音高清视频需要 540 点数,480P 模式需要 270 点数。与 Wan 3.0 参考视频计费规则一致,15 秒模板时长与 15 秒生成时长合并计费。生成失败自动全额退款。
图像 1 替换左侧演唱者,图像 2 替换右侧演唱者。生成前可以使用照片栏之间的交换按钮快速对调位置。
可以!分别上传同一人的两张不同角度或表情的照片,即可让其分饰两角出现在麦克风两侧对唱。
通常需要 15 到 20 分钟,因为 Wan 3.0 需要对整整 15 秒模板的每一帧进行高精重绘。提交后你可以离开页面,成片会自动保存在【我的视频】中。
仅限上传你本人的照片或已获得本人明确知情同意的照片。严禁上传未成年人照片,严禁将该特效用于冒充他人、虚假误导或侵犯他人肖像权。