阿里云展示全新升级的 Wan3.0 视频大模型:单条直出 30 秒长镜头,支持多达五条视频参考

8月6日,阿里云发布全新升级的Wan3.0视频生成大模型并同步开启公测,该模型在生成时长、创作参考能力、真实世界还原等核心方向实现多项突破,推动AI视频生成从碎片化镜头输出升级为可承载完整叙事的生产力工具。

阿里云展示全新升级的 Wan3.0 视频大模型:单条直出 30 秒长镜头,支持多达五条视频参考

阿里云Wan3.0视频大模型8月6日开启公测 多项核心能力完成升级

即日起,Wan3.0在阿里云百炼、万镜一刻、万相官网、千问创作PC端、IF STUDIO和堆友平台开放公测,同时在千问APP进行灰度测试,API接口将于近期全量开放。公测阶段,480P/720P/1080P分辨率的API调用价格分别为0.3/0.6/1.2元/秒。作为阿里通义实验室Wan系列模型的第三代产品,Wan3.0从1.0到3.0共历经8个版本迭代,本次升级重点覆盖生成时长、创作灵活性和画面真实感三大核心方向。

单次生成时长拓展至30秒 支持最多五条视频参考及多模态输入

生成时长的延展是Wan3.0最直观的升级点,单次可生成最长30秒高清视频,连续运镜、一镜到底等复杂镜头语言得以充分表达,让AI视频从“生成单个镜头”走向“讲述完整故事”,模型还配备智能时长推荐功能,可根据用户提示词自动匹配适配的生成时长。
在参考能力上,Wan3.0支持单次最多传入五条视频素材作为参考,同时兼容文本、图片、音频、视频四种基础模态输入,还首次支持doc、xls、ppt、pdf、md等文档格式输入,单个文件或链接不超过100MB、50页,用户上传智能眼镜产品PPT等结构化文档,搭配提示词即可生成完整的品牌形象片,真正实现“万物皆可生视频”。其输入输出规格如下:

  • 输入模态:文本、图像、视频、音频、本地文档(PDF/PPT/DOC/XLS/MD)、网页链接
  • 输出模态:带双声道音轨的完整MP4视频,支持480P/720P/1080P分辨率

像素级优化画面一致性 人物生成实现千人千面

针对视频生成行业普遍存在的人物变形、穿帮等痛点,Wan3.0重点优化了角色、道具、场景、光影风格的一致性,实现像素级特征保持。生成的人像能够精准刻画五官与皮肤细节,人物情绪表达自然克制,微表情与肢体动作彼此联动,实现“千人千面”的差异化呈现,有效避免跨镜头人像突变、道具无故消失等常见问题,UI界面、数据图表、建筑场景等数字化内容同样能维持视觉特征稳定。此外,Wan3.0的视频编辑能力也大幅提升,支持用户修改画面、剧情与台词,进一步降低创作调整门槛。

覆盖多元业务场景 按秒计费模式降低创作门槛

目前Wan3.0已适配短视频内容创作、广告物料制作、教育课件输出、影视分镜预演、电商商品演示等多元化场景,既能满足C端用户的日常创意表达需求,也能支撑B端企业的生产力工具落地。其按秒计费的定价模式让创作成本更可控,用户可根据需求选择不同分辨率,将每一次生成都转化为可规划的创作投入。
官方透露,Wan3.0在声音质感与文字准确度方面仍有持续优化的空间,后续版本迭代将针对这两项能力进行重点升级。