阿里发布Wan3.0视频模型:单次生成30秒,文档PPT一键生视频,办公素材“万物皆可转”

8.7 该模型在生成时长多模态输入参考一致性与画面真实感等维度全面升级,最大亮点在于首次支持docxlspptpdf等办公文档直接转视频,将AI视频生成从内容创作领域拉入了更广阔的办公与生产力场景

8月6日晚间,阿里云正式宣布新一代视频生成大模型Wan3.0开启公测。该模型在生成时长、多模态输入、参考一致性与画面真实感等维度全面升级,最大亮点在于首次支持doc、xls、ppt、pdf等办公文档直接转视频,将AI视频生成从内容创作领域拉入了更广阔的办公与生产力场景。

2026080701

30秒一镜到底:叙事成为可能

Wan3.0将单次视频生成时长上限提升至30秒,与字节跳动Seedance 2.5持平,成为目前行业中为数不多能达到这一时长的模型之一。

更长的时长意味着叙事空间被打开。连续运镜、一镜到底、复杂的机位变化可以在一次生成中完成,AI视频正从“生成一个精彩镜头”走向“讲述一段完整故事”。实测案例中,Wan3.0在一镜到底的唱跳MV里,面对多位舞者的复杂走位与肢体交叠,仍能保持每个人物面部特征、服饰褶皱与空间位置的同一性。模型还配套了智能时长推荐功能,可根据提示词自动匹配合适长度,并通过视频延长工具续写剧情。

文档直转视频:办公素材“一键生成”

Wan3.0此次最颠覆性的升级在输入层。除了文本、图片、音频、视频四种基础模态外,模型首次兼容doc、xls、ppt、pdf、txt、key、pages、numbers、md等9种办公文档格式,文件上限100MB、最多50页。

上传一份产品介绍PPT,配上一段提示词,模型即可自动生成完整的形象片;上传一张财务报表或业务汇报文档,也能转化为动态数据可视化短片。这意味着教学课件、产品演示、业务汇报等大量日常办公素材,如今可以直接被“翻译”为视频。

“千人千面”与一致性:告别AI塑料感

针对AI视频长期存在的“油腻感”与“千人一面”问题,Wan3.0对人物生成做了针对性优化。文生视频模式下,模型能够更敏锐地刻画五官与皮肤细节,保留毛孔、法令纹等真实特征,让同一画面中的不同人物各有各的面孔与情绪表达。

在全能参考任务中,Wan3.0可同时处理角色、道具、声音、空间关系与风格等多维度参考信息,并在生成全程保持一致性。角色五官、发型、穿搭配饰全程统一;道具Logo、材质、结构多角度无偏差;电影感、纪实风等不同画风之间不易串味。这一能力大幅降低了需要多镜头、多场景的商业广告与短剧的“穿帮”概率。

定价与可用性

即日起,Wan3.0已在阿里云百炼、万镜一刻、万相官网、千问创作PC端以及IF STUDIO、堆友等平台同步开启公测,千问APP也已灰度上线。API按视频生成秒数计费,480P、720P、1080P价格分别为0.3、0.6、1.2元/秒,约为Seedance 2.5的40%~50%,API接口将于近期全量开放。

Wan3.0的发布,标志着AI视频生成正在从“为创意者打造的工具”转向“为知识工作者打造的生产力平台”。30秒的叙事能力已接近电视广告与短剧的基本单元,而文档直转视频的功能则打开了一个更具商业想象力的场景——企业培训、产品营销、数据汇报等大量日常办公内容,未来都可能被AI视频重新定义。从3秒的动图到30秒的叙事,视频生成只用了18个月。而下一步,或许就是让AI理解整部剧本了。

千问创作平台  https://create.qianwen.com/