引言
通义万相(WanX)是阿里云通义大模型家族中的视觉生成核心成员,从 2023 年 7 月上线至今,经历了从静态图像生成到电影级视频生成的完整技术跃迁。它不仅是国内最早一批 AI 绘画模型,更在 2025 年通过开源策略成为全球最受欢迎的视频生成模型之一,累计下载量突破 500 万次。
本文将从技术架构、模型演进、性能评测三个维度,完整梳理通义万象从 1.0 到 2.6 的每一个版本,深入剖析其背后的技术突破。
一、前世:Composer 与通义万相 1.0(2023)
1.1 Composer:组合式生成模型
通义万相的技术根基源于阿里巴巴在 ICML 2023 上发表的论文《Composer: Creative and Controllable Image Synthesis with Composable Conditions》。Composer 提出了一种**"拆解-组合"**的图像生成范式,核心思想是:
- 训练阶段:将图像中的物体蒙版、颜色、深度图、线条、风格等设计元素进行拆分,分别学习每种元素的表示
- 推理阶段:将这些元素重新组合成新的图像,同时支持对单个元素的修改和编辑
这种组合爆炸带来了指数级的生成可能性——100 张图片,每张拆分为 8 种元素,理论上可产生 100^8 种组合结果。
技术特点:
- 基于扩散模型(Diffusion Model)框架
- 单模型支持多类图像生成任务(文生图、相似图生成、风格迁移)
- 高可控性:可精细控制配色、布局、风格等维度
- 无需为每个任务单独训练模型
1.2 通义万相 1.0 发布
发布时间:2023 年 7 月 7 日(WAIC 2023 世界人工智能大会)
首批上线能力:
- 文生图:支持水彩、扁平插画、二次元、油画、中国画、3D 卡通、素描等多种风格
- 相似图生成:上传任意图片,进行创意发散,生成内容/风格相似的 AI 画作
- 风格迁移:业内率先支持,上传原图+风格图即可自动转换
技术架构:
- 核心模型:Composer 组合式生成框架
- 结合扩散模型、GAN 和 CLIP 等技术
- 最大输出分辨率:1024×1024
- 仅支持静态图像生成
里程碑意义:通义万相的问世标志着阿里云在大模型领域具备了处理或生成文本、语音和图片等多模态的能力,与通义千问(语言)、通义听悟(语音)形成完整的多模态矩阵。
生态集成:同步接入钉钉,用户可通过"/"在钉钉文档、群聊、会议等场景中唤起图片生成服务。
二、转型:视频生成能力的引入(2024)
2.1 通义万相视频生成模型(2024 版)
发布时间:2024 年 9 月 19 日(杭州云栖大会)
这是通义万相从"AI 绘画"向"视觉生成大模型"转型的关键节点。
核心升级:
- 架构升级:全面升级为 Diffusion Transformer(DiT) 框架,取代原有的纯扩散模型架构
- 新增能力:文生视频、图生视频
- 视频质量:影视级高清视频
- 多语言支持:中英文提示词输入
- 多比例输出:16:9、9:16 等
技术创新:
- 运动生成优化:针对大幅度主体运动和运镜控制进行算法优化
- 物理模拟:有效模拟真实世界物理特性(碰撞、反弹等)
- 高压缩比视频 VAE:设计高压缩比、高质量视频 VAE 框架,降低视频信息冗余
- 中国风优化:基于自建中文多模态数据集(1.9TB 图像 + 2.2 万亿文本),在中式传统元素和风格化视频生成上表现突出
- 灵感扩写:结合通义千问的复杂提示词解释能力,智能丰富视频内容
截至此时的成绩:通义万相图像生成已累计生成 7500 万张图片。
三、爆发:Wan2.1 开源与登顶(2025 年初)
3.1 Wan2.1 发布
发布时间:2025 年 1 月(升级至 2.1 版本)
Wan2.1 是通义万相历史上最重要的版本,标志着其从闭源产品走向全球开源标杆。
3.2 核心架构:三大模块协同
Wan2.1 采用模块化架构设计,由三大核心组件构成:
(1)Wan-VAE:因果 3D 变分自编码器
这是通义万相自研的视频专用 VAE 架构,核心创新包括:
- 时序因果卷积:确保视频生成的连贯性和逻辑性
- 动态掩码机制:将视频序列压缩效率提升 3 倍
- 分块处理(Chunk-based Processing):将长视频分成多个时间块,每块通过因果卷积与前一块交互,类似 RNN 的隐藏状态传递
- 无限长视频支持:显存占用仅与单块大小有关,与视频总长度解耦
- 压缩比:时间维度 4 倍压缩,空间维度 8×8 压缩(总压缩比 256 倍)
性能表现:
- 支持 1080P 无限长度视频编解码
- 720P/16fps 视频生成时,显存占用比传统 VAE 降低 42%
- 重建速度达 HunYuanVideo 的 2.5 倍
(2)Video DiT:视频扩散 Transformer
- Patchify:3D 卷积核 (1,2,2),将潜变量转为 token 序列
- Transformer Block:采用全局注意力(非因果 Mask),因为视频生成需关注全局信息
- 共享时间步 MLP:所有 Transformer 块共享一个 MLP 预测 6 个调制参数,每块仅学偏置,参数量减少约 25%
- Flow Matching:基于线性噪声轨迹的流匹配方法
(3)文本编码器:umT5
- 选择 umT5(而非 CLIP)作为文本编码器
- 支持高质量中英文双语理解
- 通过交叉注意力机制融合文本与视觉信息
3.3 模型矩阵
Wan2.1 提供了完整的模型矩阵,覆盖不同场景需求:
| 模型名称 | 参数量 | 功能 | 分辨率 | 硬件需求 |
|---|---|---|---|---|
| T2V-14B | 140 亿 | 文生视频 | 480P/720P | A100/RTX 3090/4090 |
| I2V-14B-720P | 140 亿 | 图生视频 | 720P | A100/RTX 3090/4090 |
| I2V-14B-480P | 140 亿 | 图生视频 | 480P | RTX 3090/4070 Ti |
| T2V-1.3B | 13 亿 | 文生视频 | 480P | RTX 3060/4060(约 8GB 显存) |
| FLF2V-14B | 140 亿 | 首尾帧到视频 | 720P | 多 GPU 加速 |
3.4 核心能力
- 文生视频(T2V):支持中英文长文本指令,精准还原场景切换和角色互动
- 图生视频(I2V):从静态图片生成动态视频,保留输入图像细节
- 首尾帧视频(FLF2V):根据起始与结束帧智能合成中间过渡
- 复杂运动生成:稳定展现人物或物体的复杂运动(旋转、跳跃、多人同步舞蹈等)
- 物理规律模拟:通过 IC-LoRA 训练方法还原碰撞、反弹、切割等真实物理效果
- 文字特效生成:业内首个支持中英文视频内文字生成的模型
3.5 性能评测:VBench 登顶
在权威评测集 VBench 中,Wan2.1 以 86.22% 的总分大幅领先:
| 模型 | VBench 总分 |
|---|---|
| Wan2.1 | 86.22% |
| OpenAI Sora | 79.5% |
| Luma | 75.1% |
| Pika | 低于 Luma |
在运动幅度、多对象生成、ID 一致性、空间准确性和动作指令执行等维度均排名第一。
3.6 全面开源
2025 年 2 月 25 日,阿里巴巴宣布全面开源 Wan2.1,采用 Apache 2.0 协议,开放 14B 和 1.3B 参数版本的推理代码及权重。
开源成果:
- 开源 6 天登顶 Hugging Face 热榜和模型空间榜(反超 DeepSeek-R1)
- Hugging Face + 魔搭社区总下载量超百万
- GitHub Star 超 6000(后续突破 10000)
- 支持 ComfyUI、DiffSynth-Studio 等主流框架集成
四、进化:Wan2.2 MoE 架构与电影级美学(2025 年 7 月)
4.1 发布
发布时间:2025 年 7 月 28 日
Wan2.2 是全球首个开源的 MoE(混合专家)架构视频生成模型。
4.2 核心创新
(1)MoE 架构
在视频扩散模型中引入混合专家(Mixture of Experts)架构:
- 使用专门的强专家模型跨时间步分离去噪过程
- 扩大整体模型容量的同时保持相同的计算成本
- 14B 模型单次推理成本仅为稠密模型的 1/3
(2)电影级美学控制
- 整合精心策划的美学数据
- 详细的照明、构图、对比度、色调等标签
- 支持 60 多项视觉元素精细调控
- 可创建具有可定制美学偏好的视频
(3)训练数据大幅扩展
相比 Wan2.1:
- 图像数据增加 +65.6%
- 视频数据增加 +83.2%
- 显著增强模型在运动、语义和美学维度的泛化能力
(4)高效高清混合 TI2V
开源 5B 模型,使用先进的 Wan2.2-VAE(16×16×4 压缩比):
- 支持 720P@24fps 的文生视频和图生视频
- 可在消费级显卡(RTX 4090)上运行
- 目前最快的 720P@24fps 模型之一
4.3 开源模型矩阵
| 模型 | 描述 |
|---|---|
| Wan2.2-T2V-A14B | 文生视频 MoE 模型,480P & 720P |
| Wan2.2-I2V-A14B | 图生视频 MoE 模型,480P & 720P |
| Wan2.2-TI2V-5B | 统一文图生视频,720P@24fps,消费级显卡可运行 |
截至 2025 年 7 月底,通义万相系列在开源社区下载量已超 500 万。
五、突破:Wan2.5 音画同步(2025 年 9 月)
5.1 发布
发布时间:2025 年 9 月 24 日(云栖大会)
Wan2.5-preview 首次实现音画同步能力,被称为"Veo 3 的真正对手"。
5.2 核心突破
(1)原生音画同步
- 自动生成与画面匹配的人声、环境音效和背景音乐 BGM
- 支持中文、英文、小语种及方言
- 人声口型与画面精准对齐
- 支持多人对话场景
(2)视频时长翻倍
- 单次视频时长从 5 秒提升至 10 秒
- 最高输出 1080P 24fps
- 动态连贯性与结构稳定性显著增强
(3)原生多模态统一架构
单一模型支持四大功能:
- 文生视频
- 图生视频
- 首尾帧视频
- 全能编辑
(4)指令理解升级
- 支持复杂连续动作描述
- 精准理解运镜等复杂连续变化的指令
- 结构化提示词输入
(5)图生视频 ID 保持优化
人物形象、商品外观等方面实现更高一致性,适用于品牌广告与虚拟角色制作。
(6)通用音频驱动视频
可上传自定义音频作为引导,结合提示词或首帧图像生成匹配的视频内容。
5.3 文生图能力升级
- 光影真实感更强,细节刻画更精细
- 稳定文字渲染:中英文、小语种、艺术字体、长段落文本
- 图表直接输出:科学图表、流程图、数据可视化图、系统架构图
- 指令理解深化:对复杂指令具备逻辑推理能力
六、巅峰:Wan2.6 角色扮演与多镜头叙事(2025 年 12 月)
6.1 发布
发布时间:2025 年 12 月 16 日
Wan2.6 是国内首个支持角色扮演功能的视频模型。
6.2 核心创新
(1)角色扮演:万物皆可为主演
- 参考输入视频中的角色外观和音色
- 实现写实级角色扮演
- 支持单人表演、多人合拍、人与物合拍
- 从"换脸"升级到"全感官演绎"(声画同步)
技术实现:对输入参考视频进行多模态联合建模与学习,提取:
- 主体情绪、姿态、多角度视觉特征
- 音色、语速等声学特征
- 生成阶段作为条件控制,实现画面到声音的全维度一致性迁移
(2)智能多镜头叙事
- 将用户简单提示词转换为多分镜脚本
- 生成包含多个镜头的连贯叙事视频
- 多镜头间保持主体、场景等关键信息一致性
- 自动实现多镜头切换等专业任务
(3)性能提升
- 单次视频时长达 15 秒(国内最高)
- 1080P 分辨率
- 画质、音效、指令遵循能力进一步提升
6.3 模型矩阵
Wan2.6 系列涵盖五大模型:
- 文生视频
- 图生视频
- 参考生视频(全新功能)
- 图像生成
- 文生图
七、全能:Wan2.7 从"生成"到"导演"(2026 年 4 月)
7.1 发布
发布时间:2026 年 4 月 1 日(Wan2.7-Image)、4 月 3 日(Wan2.7-Video)
Wan2.7 标志着通义万相从"生成工具"进化为**"创作系统"**,将 AI 的能力从单一素材生成扩展至创作全链路,从"演"迈向"导"。
7.2 Wan2.7-Video:四大视频模型
Wan2.7-Video 涵盖四大专业模型,构成完整工作流:
| 模型 | 功能 | 定位 |
|---|---|---|
| Wan2.7-t2v | 文生视频 | 从零创作 |
| Wan2.7-i2v | 图生视频 | 画面控制(首帧/首尾帧/续写) |
| Wan2.7-r2v | 参考生视频 | 演绎复刻 |
| Wan2.7-videoedit | 视频编辑 | 精细编辑 |
全系列支持 720P/1080P 分辨率输出,视频时长 2-15 秒自由指定,帧率 30fps。
7.3 核心创新
(1)视频像文档一样可编辑
这是 Wan2.7 最具变革性的能力。通过自然语言指令对已有视频进行局部或整体修改:
- 元素增删替换:删掉视频中的火车、把胶片替换成盘子
- 场景环境切换:晴天改雨天、夏季改冬季
- 视觉风格变换:写实转水彩、真人转黏土动画
- 角色控制:行为、表情、情绪均可调整,台词可替换并自动匹配口型与音色
- 拍摄方式重定义:机位、视角、景别、焦距等参数可调
(2)首尾帧控制 + 视频续写
- 同时定义视频的起点和终点,模型推算中间运动轨迹
- 视频续写与尾帧控制联合机制:续写时可指定结尾画面
- 消除传统首尾帧方案中常见的"刹车感"
- 支持串联多个片段:上一片段末帧作为下一片段首帧,实现无缝过渡
(3)9 宫格多角度参考输入
- 支持 3×3 图片矩阵输入(同一主体多角度照片、连续动作关键帧、场景变体)
- 最多支持 5 个视频主体参考(业内最多)
- 角度切换时不会出现"角色漂移"
(4)动作与特效复刻
- 基于参考视频快速复刻动作、运镜和特效
- 大幅度复杂动作也能稳定还原
- 主体外观 + 声音方向联合参考
(5)智能剧本创作与分镜调度
- 一段简短文字描述即可编排剧情节奏
- 设计镜头语言与场景转换
- 涵盖多种题材与运镜方案
(6)视觉风格延展
- 覆盖 2D 卡通、3D 动画、水墨、黏土、赛璐璐等多种视觉语言
- 可延展出上千种风格组合
7.4 Wan2.7-Image:图像生成与编辑统一模型
发布时间:2026 年 4 月 1 日
Wan2.7-Image 集文生图、图生组图、图像指令编辑和交互式编辑于一体:
核心能力:
- "千人千面"捏脸:从骨相、眼眸到五官细微处全方位定制,告别"AI 脸"
- 首创"调色盘"功能:通过 HEX Code 一键提取或输入参考图的颜色和占比
- 3K Token 超长文本渲染:支持 12 种语言,最高 3K tokens 输入,可输出一页 A4 纸的论文
- 组图生成:最多 12 张,用于系列图、PPT 配图、分镜脚本、电商套图
- 像素级交互式编辑:框选区域内元素精准移动、替换和修改
- OpenClaw 支持:让龙虾(OpenClaw)画画,解锁更多应用场景
性能表现:
- 在人类偏好盲测中,"文生图"能力超过 GPT-Image1.5 和国内主流模型
- 文本渲染、照片级成像和世界知识指标接近 Nano Banana Pro
7.5 从"抽卡"到"导演"的范式转变
Wan2.7 的核心转变在于改变了创作者与模型之间的关系:
- Wan2.6 及之前:创作本质是"抽卡"——写好提示词,点击生成,看结果是否符合预期
- Wan2.7:创作变成"导演"——定义起点和终点,用自然语言修改已有片段,用多角度参考图约束生成方向
工作流从"生成→筛选→重来"变为"生成→编辑→迭代",迭代成本大幅降低。
八、技术架构演进总览
| 版本 | 发布时间 | 核心架构 | 关键突破 | 最大分辨率 | 视频时长 |
|---|---|---|---|---|---|
| 1.0 | 2023.07 | Composer(组合式扩散模型) | 文生图、风格迁移 | 1024×1024 | 静态图像 |
| 2024 版 | 2024.09 | DiT + 视频 VAE | 视频生成能力引入 | 影视级高清 | 5 秒 |
| 2.1 | 2025.01 | 因果 3D VAE + Video DiT + umT5 | 开源、VBench 登顶 | 720P | 5 秒 |
| 2.2 | 2025.07 | MoE + 电影级美学 | 首个开源 MoE 视频模型 | 720P@24fps | 5 秒 |
| 2.5 | 2025.09 | 原生多模态统一 | 音画同步 | 1080P@24fps | 10 秒 |
| 2.6 | 2025.12 | 多模态联合建模 | 角色扮演 + 多镜头叙事 | 1080P | 15 秒 |
| 2.7 | 2026.04 | 全模态统一创作系统 | 视频可编辑 + 图像统一模型 | 1080P@30fps | 2-15 秒 |
九、开源生态与行业影响
9.1 开源数据
- 协议:Apache 2.0(免费商用)
- 平台:Hugging Face、ModelScope(魔搭社区)、GitHub
- 下载量:超 500 万次(截至 2025 年 7 月)
- GitHub Star:超 10000
- 登顶记录:Hugging Face 热榜 + 模型空间榜双榜第一
9.2 生态集成
- ComfyUI:官方插件支持
- DiffSynth-Studio:魔搭社区全链路推理和训练优化工具
- Stable Diffusion WebUI:社区插件支持
- 阿里云百炼平台:API 服务
- 钉钉:深度集成
- 千问 App:免费体验入口
9.3 商业化落地
- 电商广告:5 分钟生成商品展示视频,成本从 20 万降至 200 元
- 影视创作:快速制作概念动画,开发周期缩短 70%
- 教育:古诗教学动画、历史场景复原
- 个人创作:AI 短剧、个人艺术照
9.4 行业认可
- VBench 评测总分第一(86.22%),超越 Sora、Luma、Pika
- 累计生成 7500 万张图像(截至 2024 年 9 月)
- 视频生成请求超 100 万次
- 服务企业及开发者超 30 万
十、总结
通义万相从 2023 年的 AI 绘画工具,到 2026 年全能型视觉创作系统,走出了一条清晰的技术演进路线:
- Composer 时代(2023):组合式生成奠定可控性基础
- DiT 转型(2024):架构升级引入视频能力
- 开源爆发(2025 初):Wan2.1 登顶 VBench,开源即屠榜
- MoE 创新(2025 中):Wan2.2 首创 MoE 视频生成架构
- 音画同步(2025 秋):Wan2.5 对标 Veo 3
- 角色扮演(2025 冬):Wan2.6 实现全感官演绎
- 全能导演(2026 春):Wan2.7 从"生成工具"进化为"创作系统"
通义万相的成功证明了开源策略在视觉生成领域的巨大威力——通过开放核心模型能力,吸引全球开发者共建生态,最终实现技术迭代与商业落地的双赢。在 AI 视频生成这条赛道上,通义万相已经从"中国版 Sora"成长为真正的全球领跑者。
参考链接:
- 通义万相官网:https://tongyi.aliyun.com/wanxiang/
- GitHub:https://github.com/Wan-Video/Wan2.2
- Hugging Face:https://huggingface.co/Wan-AI
- 技术报告:https://arxiv.org/abs/2503.20314