1. 通义万相介绍

初识通义万相
通义万相(Tongyi Wanxiang,英文 Wan)是由中国阿里巴巴集团旗下阿里云研发的生成式 AI 视觉创作平台。它于 2023 年 7 月 7 日正式发布,最初以 AI 绘画模型的形态开启定向邀测;2024 年 9 月的云栖大会上,阿里进一步推出万相视频生成大模型,被外界称为"最懂中国风"的视频大模型。此后万相保持高速迭代,截至 2026 年初已覆盖文生图、图像编辑、文生视频、图生视频、声音生视频、视频编辑、数字人等十余种视觉创作能力,成为业内公认功能最全的视频生成模型之一,稳居国产视觉生成模型第一梯队。
万相的能力建立在自研的"原生多模态统一框架"之上:通过高效的 VAE 与 DiT 架构增强时空建模,在画面质量、语义理解、运动幅度、物理规律遵循与艺术质感等维度均达到业界领先水平,并曾以 84.7% 的总分登顶权威视频评测榜单 VBench。真正让万相区别于同类模型的,一是架构创新——自 2.2 版起,万相成为业界首个采用 MoE(Mixture of Experts,混合专家)架构的视频生成基础模型,由两个专家分别负责画面整体布局与细节完善,在同等参数规模下节省约一半算力;二是开放路线——万相 2.1、2.2 等核心模型基于最宽松的 Apache 2.0 协议全面开源,推理代码与权重向全球开发者公开,衍生生态迅速壮大。
2026 年 4 月发布的万相 2.7,将 AI 视觉创作从"碰运气抽卡"推向"工业级可控"。视频侧的 Wan2.7-Video 打通文生视频、图生视频、参考生视频与视频编辑四大能力,支持一句话修改视频画面(增删元素、换装、改背景并自动匹配光影)、2 秒续写至 15 秒、动作模仿与声画同步;图像侧的 Wan2.7-Image 则作为图像生成与编辑统一模型,主打"千人千面"骨相级捏脸、可用 Hex 色号精准控制的"调色盘"、以及最高约 3K token 的印刷级长文本渲染,Pro 版更支持接近 4K 的高清输出。至此,万相已从早期的"AI 绘画玩具"演化为面向影视、电商、设计等专业场景的生产力工具。

评论
0 条