跳转到主内容
Abstract video production studio where documents and media flow into a cinematic sequence

阿里巴巴 Wan3.0 可根据提示词、媒体和文档生成 30 秒视频

Wan3.0 将单次视频生成延长到 30 秒并加入文档输入;阿里巴巴同时承认音频与文字渲染仍有限制。

发布时间

27 8月 2026

阅读时间

3 分钟阅读

分享这篇文章:

目录

阿里巴巴推出了可通过 Alibaba Cloud Model Studio 使用的视频生成模型 Wan3.0。The Next Web 于 2026 年 8 月 24 日报道了此次发布。阿里巴巴官方资料称,该模型单次可生成最长 30 秒的视频,并能把文本、图像、音频、视频、文档和网页作为输入。

从短片段扩展到更长序列

与常见的几秒生成视频相比,30 秒为节奏和连续镜头运动提供了更多空间。Wan3.0 还提供时长建议,并能延长已有生成结果,目标是制作完整的短内容,而不只是孤立镜头。

阿里巴巴称 Model Studio 支持 480p、720p 和 1080p 输出,并宣传原生音视频生成,以及人物、物体、空间和风格的一致性。这些属于供应商声明;TechKili 未对模型进行独立基准测试,因此应以真实工作负载评估保真度和一致性。

文档也成为视频输入

较特别的新功能是文档输入。阿里巴巴列出了 PDF、演示文稿、电子表格和文字处理文件等格式,并在 Model Studio 文档中说明每次请求的文件数量和大小限制。其目标是把培训资料、报告或产品简报转化为带叙事的视频序列。

这可能减少分镜制作工作,但也带来治理问题。团队需要有权上传源文件,必须核对生成内容,并判断机密资料是否适合交给托管服务。未经人工验证,生成的图表或旁白不应被视为忠实摘要。

编辑能力与已知限制

Wan3.0 延续了无需完全重新生成即可修改画面、情节和对白的编辑功能。阿里巴巴明确承认,音频质感和屏幕文字准确性仍需改进。这一点很重要,因为二者都是生产视频的常见失败点,尤其是在必须保留精确文案和品牌素材时。

因此,实际进步在于更广的控制范围和更长输出,而不是已经完全可靠。创作者在进入生产流程前应测试时间一致性、指令遵循、文字准确性、权利管理和导出质量。

接下来值得关注什么

Wan3.0 已在 Model Studio 提供。独立比较、地区可用性、内容安全措施和数据处理文档将决定它适合哪些场景。现阶段,阿里巴巴扩大了视频系统的输入范围和时长,同时也承认关键质量差距仍然存在。

来源与方法

标签:

#Alibaba #Wan3.0 #AI video #generative AI #Model Studio #multimodal AI

19

浏览

0

分享

0

点赞

相关文章