一个模型,掌控整个拍摄。
文本、图片、视频或音频输入无需分别调用模型。阿里云 Wan 3.0 通过一次调用处理所有参考素材,搭建整个镜头,并保持全程一致。
2–30s
一次生成即可获得 2 到 30 秒的原生视频。设定精确时长,或交由智能时长功能读取素材后自行决定。
通用引用
单次调用最多支持 10 张图片、5 段视频剪辑和 5 条音轨,角色、道具、声音与空间布局均保持像素级一致。
文字始终是文字
界面、动画和屏幕文字以结构化内容渲染,而非纹理。
自适应比例
从 16:9 到 9:16 的五种固定画幅,外加自适应模式:模型读取你的素材后自行选择构图。
声音,默认原生同步。
音频与画面在同一流程中渲染,从第一帧起就保持同步。
4K
借助 Magnific 精修至 4K
模型最高可渲染 1080p 画质。镜头满意后,Magnific 的视频增强器无需切换套件即可将其精修至 4K。


从首张参考图到 4K 母版
Wan 3.0 负责生成画面,Magnific 负责画面前后的一切。
图片、视频、音频,一次调用完成。
单次生成中,为 Wan 3.0 提供多达 10 张图片、5 段视频和 5 条音轨,按场景所需自由组合。像素级一致性让一切保持统一:角色的面部特征不变,道具的位置不变,镜头与镜头之间始终连贯。
三十秒。一次成片。
一次生成即可获得三十秒的原生视频,画面与声音同步呈现。设定所需的精确秒数,或交由智能时长功能读取故事内容后自行决定。镜头由此升级为一个场景。
稳定呈现的界面、标题和文字。
软件界面、动画和屏幕文字都以结构化内容渲染,每一帧都清晰可读。
画面与配乐同步生成
这里的声音不是后期步骤。音效与音乐与画面在同一次生成中渲染完成,并与屏幕上的画面同步。默认开启,若需要静默效果,可随时关闭。
以 4K 完成,就在 Magnific 内。
Wan 3.0 原生渲染最高可达 1080p 的画面。选出最满意的一版,用 Magnific 增强器处理,无需离开套件即可交付 4K 成片,无需重新拍摄。


从一个提示词到一个完整场景
广告
一次生成即完成 30 秒广告片,产品、配乐和节奏从第一帧起就已锁定。
电商
精准还原产品本身的产品主图。参考你已有的镜头,保留每一处细节。
社交媒体
自带配乐的短视频。特效与音乐一步到位,无需后期配音。
影视与 Originals
有呼吸空间的微剧和动作场景:一次生成即成完整故事弧。
工作室与代理机构
一个可复用的 Spaces 工作流,打包成应用,让全团队都能复现同样的输出。
常见问题
- Wan 3.0 是阿里云推出的全新一体化视频模型。不再区分文字转视频、图片转视频或编辑等不同版本:一次调用即可处理所有输入。此外,还支持原生 30 秒生成、画面与声音同步渲染,以及具备像素级一致性的通用参考。
- 原生支持 2 到 30 秒时长。智能时长功能可读取你的提示词和素材,并自动为你设定时长。
- 是的。音频与视频在同一次生成中完成,且默认开启。如需静音,可将其关闭。
- 单次调用最多可使用 10 张图片、5 个视频片段和 5 条音轨,可根据场景需要自由组合,并在角色、道具、声音和空间上保持像素级一致性。
- 支持 16:9、4:3、1:1、3:4 和 9:16,以及自适应模式:模型会根据你的意图和素材自动选择画幅。
- Wan 3.0 最高可生成 1080p 视频。在 Magnific 中,你可以使用视频增强器完成到 4K 的处理,全部在同一处完成参考构建和成片挑选。
- 可以。通过 Magnific 的 MCP 和 API,你可以在 Claude、ChatGPT、Cursor 或自有应用中运行 Wan 3.0,并使用你常规的 Magnific 积分。
由 Wan 3.0 制作
适用地区限制。 须遵守可接受使用政策。

