Back

通义万象前世今生:从 AI 绘画到电影级视频生成的完整演进

引言

通义万相(WanX)是阿里云通义大模型家族中的视觉生成核心成员,从 2023 年 7 月上线至今,经历了从静态图像生成到电影级视频生成的完整技术跃迁。它不仅是国内最早一批 AI 绘画模型,更在 2025 年通过开源策略成为全球最受欢迎的视频生成模型之一,累计下载量突破 500 万次。

本文将从技术架构、模型演进、性能评测三个维度,完整梳理通义万象从 1.0 到 2.6 的每一个版本,深入剖析其背后的技术突破。

一、前世:Composer 与通义万相 1.0(2023)

1.1 Composer:组合式生成模型

通义万相的技术根基源于阿里巴巴在 ICML 2023 上发表的论文《Composer: Creative and Controllable Image Synthesis with Composable Conditions》。Composer 提出了一种**"拆解-组合"**的图像生成范式,核心思想是:

  • 训练阶段:将图像中的物体蒙版、颜色、深度图、线条、风格等设计元素进行拆分,分别学习每种元素的表示
  • 推理阶段:将这些元素重新组合成新的图像,同时支持对单个元素的修改和编辑

这种组合爆炸带来了指数级的生成可能性——100 张图片,每张拆分为 8 种元素,理论上可产生 100^8 种组合结果。

技术特点

  • 基于扩散模型(Diffusion Model)框架
  • 单模型支持多类图像生成任务(文生图、相似图生成、风格迁移)
  • 高可控性:可精细控制配色、布局、风格等维度
  • 无需为每个任务单独训练模型

1.2 通义万相 1.0 发布

发布时间:2023 年 7 月 7 日(WAIC 2023 世界人工智能大会)

首批上线能力

  • 文生图:支持水彩、扁平插画、二次元、油画、中国画、3D 卡通、素描等多种风格
  • 相似图生成:上传任意图片,进行创意发散,生成内容/风格相似的 AI 画作
  • 风格迁移:业内率先支持,上传原图+风格图即可自动转换

技术架构

  • 核心模型:Composer 组合式生成框架
  • 结合扩散模型、GAN 和 CLIP 等技术
  • 最大输出分辨率:1024×1024
  • 仅支持静态图像生成

里程碑意义:通义万相的问世标志着阿里云在大模型领域具备了处理或生成文本、语音和图片等多模态的能力,与通义千问(语言)、通义听悟(语音)形成完整的多模态矩阵。

生态集成:同步接入钉钉,用户可通过"/"在钉钉文档、群聊、会议等场景中唤起图片生成服务。

二、转型:视频生成能力的引入(2024)

2.1 通义万相视频生成模型(2024 版)

发布时间:2024 年 9 月 19 日(杭州云栖大会)

这是通义万相从"AI 绘画"向"视觉生成大模型"转型的关键节点。

核心升级

  • 架构升级:全面升级为 Diffusion Transformer(DiT) 框架,取代原有的纯扩散模型架构
  • 新增能力:文生视频、图生视频
  • 视频质量:影视级高清视频
  • 多语言支持:中英文提示词输入
  • 多比例输出:16:9、9:16 等

技术创新

  1. 运动生成优化:针对大幅度主体运动和运镜控制进行算法优化
  2. 物理模拟:有效模拟真实世界物理特性(碰撞、反弹等)
  3. 高压缩比视频 VAE:设计高压缩比、高质量视频 VAE 框架,降低视频信息冗余
  4. 中国风优化:基于自建中文多模态数据集(1.9TB 图像 + 2.2 万亿文本),在中式传统元素和风格化视频生成上表现突出
  5. 灵感扩写:结合通义千问的复杂提示词解释能力,智能丰富视频内容

截至此时的成绩:通义万相图像生成已累计生成 7500 万张图片。

三、爆发:Wan2.1 开源与登顶(2025 年初)

3.1 Wan2.1 发布

发布时间:2025 年 1 月(升级至 2.1 版本)

Wan2.1 是通义万相历史上最重要的版本,标志着其从闭源产品走向全球开源标杆。

3.2 核心架构:三大模块协同

Wan2.1 采用模块化架构设计,由三大核心组件构成:

(1)Wan-VAE:因果 3D 变分自编码器

这是通义万相自研的视频专用 VAE 架构,核心创新包括:

  • 时序因果卷积:确保视频生成的连贯性和逻辑性
  • 动态掩码机制:将视频序列压缩效率提升 3 倍
  • 分块处理(Chunk-based Processing):将长视频分成多个时间块,每块通过因果卷积与前一块交互,类似 RNN 的隐藏状态传递
  • 无限长视频支持:显存占用仅与单块大小有关,与视频总长度解耦
  • 压缩比:时间维度 4 倍压缩,空间维度 8×8 压缩(总压缩比 256 倍)

性能表现

  • 支持 1080P 无限长度视频编解码
  • 720P/16fps 视频生成时,显存占用比传统 VAE 降低 42%
  • 重建速度达 HunYuanVideo 的 2.5 倍

(2)Video DiT:视频扩散 Transformer

  • Patchify:3D 卷积核 (1,2,2),将潜变量转为 token 序列
  • Transformer Block:采用全局注意力(非因果 Mask),因为视频生成需关注全局信息
  • 共享时间步 MLP:所有 Transformer 块共享一个 MLP 预测 6 个调制参数,每块仅学偏置,参数量减少约 25%
  • Flow Matching:基于线性噪声轨迹的流匹配方法

(3)文本编码器:umT5

  • 选择 umT5(而非 CLIP)作为文本编码器
  • 支持高质量中英文双语理解
  • 通过交叉注意力机制融合文本与视觉信息

3.3 模型矩阵

Wan2.1 提供了完整的模型矩阵,覆盖不同场景需求:

模型名称 参数量 功能 分辨率 硬件需求
T2V-14B 140 亿 文生视频 480P/720P A100/RTX 3090/4090
I2V-14B-720P 140 亿 图生视频 720P A100/RTX 3090/4090
I2V-14B-480P 140 亿 图生视频 480P RTX 3090/4070 Ti
T2V-1.3B 13 亿 文生视频 480P RTX 3060/4060(约 8GB 显存)
FLF2V-14B 140 亿 首尾帧到视频 720P 多 GPU 加速

3.4 核心能力

  1. 文生视频(T2V):支持中英文长文本指令,精准还原场景切换和角色互动
  2. 图生视频(I2V):从静态图片生成动态视频,保留输入图像细节
  3. 首尾帧视频(FLF2V):根据起始与结束帧智能合成中间过渡
  4. 复杂运动生成:稳定展现人物或物体的复杂运动(旋转、跳跃、多人同步舞蹈等)
  5. 物理规律模拟:通过 IC-LoRA 训练方法还原碰撞、反弹、切割等真实物理效果
  6. 文字特效生成:业内首个支持中英文视频内文字生成的模型

3.5 性能评测:VBench 登顶

在权威评测集 VBench 中,Wan2.1 以 86.22% 的总分大幅领先:

模型 VBench 总分
Wan2.1 86.22%
OpenAI Sora 79.5%
Luma 75.1%
Pika 低于 Luma

在运动幅度、多对象生成、ID 一致性、空间准确性和动作指令执行等维度均排名第一。

3.6 全面开源

2025 年 2 月 25 日,阿里巴巴宣布全面开源 Wan2.1,采用 Apache 2.0 协议,开放 14B 和 1.3B 参数版本的推理代码及权重。

开源成果

  • 开源 6 天登顶 Hugging Face 热榜和模型空间榜(反超 DeepSeek-R1)
  • Hugging Face + 魔搭社区总下载量超百万
  • GitHub Star 超 6000(后续突破 10000)
  • 支持 ComfyUI、DiffSynth-Studio 等主流框架集成

四、进化:Wan2.2 MoE 架构与电影级美学(2025 年 7 月)

4.1 发布

发布时间:2025 年 7 月 28 日

Wan2.2 是全球首个开源的 MoE(混合专家)架构视频生成模型。

4.2 核心创新

(1)MoE 架构

在视频扩散模型中引入混合专家(Mixture of Experts)架构:

  • 使用专门的强专家模型跨时间步分离去噪过程
  • 扩大整体模型容量的同时保持相同的计算成本
  • 14B 模型单次推理成本仅为稠密模型的 1/3

(2)电影级美学控制

  • 整合精心策划的美学数据
  • 详细的照明、构图、对比度、色调等标签
  • 支持 60 多项视觉元素精细调控
  • 可创建具有可定制美学偏好的视频

(3)训练数据大幅扩展

相比 Wan2.1:

  • 图像数据增加 +65.6%
  • 视频数据增加 +83.2%
  • 显著增强模型在运动、语义和美学维度的泛化能力

(4)高效高清混合 TI2V

开源 5B 模型,使用先进的 Wan2.2-VAE(16×16×4 压缩比):

  • 支持 720P@24fps 的文生视频和图生视频
  • 可在消费级显卡(RTX 4090)上运行
  • 目前最快的 720P@24fps 模型之一

4.3 开源模型矩阵

模型 描述
Wan2.2-T2V-A14B 文生视频 MoE 模型,480P & 720P
Wan2.2-I2V-A14B 图生视频 MoE 模型,480P & 720P
Wan2.2-TI2V-5B 统一文图生视频,720P@24fps,消费级显卡可运行

截至 2025 年 7 月底,通义万相系列在开源社区下载量已超 500 万。

五、突破:Wan2.5 音画同步(2025 年 9 月)

5.1 发布

发布时间:2025 年 9 月 24 日(云栖大会)

Wan2.5-preview 首次实现音画同步能力,被称为"Veo 3 的真正对手"。

5.2 核心突破

(1)原生音画同步

  • 自动生成与画面匹配的人声、环境音效和背景音乐 BGM
  • 支持中文、英文、小语种及方言
  • 人声口型与画面精准对齐
  • 支持多人对话场景

(2)视频时长翻倍

  • 单次视频时长从 5 秒提升至 10 秒
  • 最高输出 1080P 24fps
  • 动态连贯性与结构稳定性显著增强

(3)原生多模态统一架构

单一模型支持四大功能:

  • 文生视频
  • 图生视频
  • 首尾帧视频
  • 全能编辑

(4)指令理解升级

  • 支持复杂连续动作描述
  • 精准理解运镜等复杂连续变化的指令
  • 结构化提示词输入

(5)图生视频 ID 保持优化

人物形象、商品外观等方面实现更高一致性,适用于品牌广告与虚拟角色制作。

(6)通用音频驱动视频

可上传自定义音频作为引导,结合提示词或首帧图像生成匹配的视频内容。

5.3 文生图能力升级

  • 光影真实感更强,细节刻画更精细
  • 稳定文字渲染:中英文、小语种、艺术字体、长段落文本
  • 图表直接输出:科学图表、流程图、数据可视化图、系统架构图
  • 指令理解深化:对复杂指令具备逻辑推理能力

六、巅峰:Wan2.6 角色扮演与多镜头叙事(2025 年 12 月)

6.1 发布

发布时间:2025 年 12 月 16 日

Wan2.6 是国内首个支持角色扮演功能的视频模型。

6.2 核心创新

(1)角色扮演:万物皆可为主演

  • 参考输入视频中的角色外观和音色
  • 实现写实级角色扮演
  • 支持单人表演、多人合拍、人与物合拍
  • 从"换脸"升级到"全感官演绎"(声画同步)

技术实现:对输入参考视频进行多模态联合建模与学习,提取:

  • 主体情绪、姿态、多角度视觉特征
  • 音色、语速等声学特征
  • 生成阶段作为条件控制,实现画面到声音的全维度一致性迁移

(2)智能多镜头叙事

  • 将用户简单提示词转换为多分镜脚本
  • 生成包含多个镜头的连贯叙事视频
  • 多镜头间保持主体、场景等关键信息一致性
  • 自动实现多镜头切换等专业任务

(3)性能提升

  • 单次视频时长达 15 秒(国内最高)
  • 1080P 分辨率
  • 画质、音效、指令遵循能力进一步提升

6.3 模型矩阵

Wan2.6 系列涵盖五大模型:

  • 文生视频
  • 图生视频
  • 参考生视频(全新功能)
  • 图像生成
  • 文生图

七、全能:Wan2.7 从"生成"到"导演"(2026 年 4 月)

7.1 发布

发布时间:2026 年 4 月 1 日(Wan2.7-Image)、4 月 3 日(Wan2.7-Video)

Wan2.7 标志着通义万相从"生成工具"进化为**"创作系统"**,将 AI 的能力从单一素材生成扩展至创作全链路,从"演"迈向"导"。

7.2 Wan2.7-Video:四大视频模型

Wan2.7-Video 涵盖四大专业模型,构成完整工作流:

模型 功能 定位
Wan2.7-t2v 文生视频 从零创作
Wan2.7-i2v 图生视频 画面控制(首帧/首尾帧/续写)
Wan2.7-r2v 参考生视频 演绎复刻
Wan2.7-videoedit 视频编辑 精细编辑

全系列支持 720P/1080P 分辨率输出,视频时长 2-15 秒自由指定,帧率 30fps

7.3 核心创新

(1)视频像文档一样可编辑

这是 Wan2.7 最具变革性的能力。通过自然语言指令对已有视频进行局部或整体修改:

  • 元素增删替换:删掉视频中的火车、把胶片替换成盘子
  • 场景环境切换:晴天改雨天、夏季改冬季
  • 视觉风格变换:写实转水彩、真人转黏土动画
  • 角色控制:行为、表情、情绪均可调整,台词可替换并自动匹配口型与音色
  • 拍摄方式重定义:机位、视角、景别、焦距等参数可调

(2)首尾帧控制 + 视频续写

  • 同时定义视频的起点和终点,模型推算中间运动轨迹
  • 视频续写与尾帧控制联合机制:续写时可指定结尾画面
  • 消除传统首尾帧方案中常见的"刹车感"
  • 支持串联多个片段:上一片段末帧作为下一片段首帧,实现无缝过渡

(3)9 宫格多角度参考输入

  • 支持 3×3 图片矩阵输入(同一主体多角度照片、连续动作关键帧、场景变体)
  • 最多支持 5 个视频主体参考(业内最多)
  • 角度切换时不会出现"角色漂移"

(4)动作与特效复刻

  • 基于参考视频快速复刻动作、运镜和特效
  • 大幅度复杂动作也能稳定还原
  • 主体外观 + 声音方向联合参考

(5)智能剧本创作与分镜调度

  • 一段简短文字描述即可编排剧情节奏
  • 设计镜头语言与场景转换
  • 涵盖多种题材与运镜方案

(6)视觉风格延展

  • 覆盖 2D 卡通、3D 动画、水墨、黏土、赛璐璐等多种视觉语言
  • 可延展出上千种风格组合

7.4 Wan2.7-Image:图像生成与编辑统一模型

发布时间:2026 年 4 月 1 日

Wan2.7-Image 集文生图、图生组图、图像指令编辑和交互式编辑于一体:

核心能力

  • "千人千面"捏脸:从骨相、眼眸到五官细微处全方位定制,告别"AI 脸"
  • 首创"调色盘"功能:通过 HEX Code 一键提取或输入参考图的颜色和占比
  • 3K Token 超长文本渲染:支持 12 种语言,最高 3K tokens 输入,可输出一页 A4 纸的论文
  • 组图生成:最多 12 张,用于系列图、PPT 配图、分镜脚本、电商套图
  • 像素级交互式编辑:框选区域内元素精准移动、替换和修改
  • OpenClaw 支持:让龙虾(OpenClaw)画画,解锁更多应用场景

性能表现

  • 在人类偏好盲测中,"文生图"能力超过 GPT-Image1.5 和国内主流模型
  • 文本渲染、照片级成像和世界知识指标接近 Nano Banana Pro

7.5 从"抽卡"到"导演"的范式转变

Wan2.7 的核心转变在于改变了创作者与模型之间的关系:

  • Wan2.6 及之前:创作本质是"抽卡"——写好提示词,点击生成,看结果是否符合预期
  • Wan2.7:创作变成"导演"——定义起点和终点,用自然语言修改已有片段,用多角度参考图约束生成方向

工作流从"生成→筛选→重来"变为"生成→编辑→迭代",迭代成本大幅降低。

八、技术架构演进总览

版本 发布时间 核心架构 关键突破 最大分辨率 视频时长
1.0 2023.07 Composer(组合式扩散模型) 文生图、风格迁移 1024×1024 静态图像
2024 版 2024.09 DiT + 视频 VAE 视频生成能力引入 影视级高清 5 秒
2.1 2025.01 因果 3D VAE + Video DiT + umT5 开源、VBench 登顶 720P 5 秒
2.2 2025.07 MoE + 电影级美学 首个开源 MoE 视频模型 720P@24fps 5 秒
2.5 2025.09 原生多模态统一 音画同步 1080P@24fps 10 秒
2.6 2025.12 多模态联合建模 角色扮演 + 多镜头叙事 1080P 15 秒
2.7 2026.04 全模态统一创作系统 视频可编辑 + 图像统一模型 1080P@30fps 2-15 秒

九、开源生态与行业影响

9.1 开源数据

  • 协议:Apache 2.0(免费商用)
  • 平台:Hugging Face、ModelScope(魔搭社区)、GitHub
  • 下载量:超 500 万次(截至 2025 年 7 月)
  • GitHub Star:超 10000
  • 登顶记录:Hugging Face 热榜 + 模型空间榜双榜第一

9.2 生态集成

  • ComfyUI:官方插件支持
  • DiffSynth-Studio:魔搭社区全链路推理和训练优化工具
  • Stable Diffusion WebUI:社区插件支持
  • 阿里云百炼平台:API 服务
  • 钉钉:深度集成
  • 千问 App:免费体验入口

9.3 商业化落地

  • 电商广告:5 分钟生成商品展示视频,成本从 20 万降至 200 元
  • 影视创作:快速制作概念动画,开发周期缩短 70%
  • 教育:古诗教学动画、历史场景复原
  • 个人创作:AI 短剧、个人艺术照

9.4 行业认可

  • VBench 评测总分第一(86.22%),超越 Sora、Luma、Pika
  • 累计生成 7500 万张图像(截至 2024 年 9 月)
  • 视频生成请求超 100 万次
  • 服务企业及开发者超 30 万

十、总结

通义万相从 2023 年的 AI 绘画工具,到 2026 年全能型视觉创作系统,走出了一条清晰的技术演进路线:

  1. Composer 时代(2023):组合式生成奠定可控性基础
  2. DiT 转型(2024):架构升级引入视频能力
  3. 开源爆发(2025 初):Wan2.1 登顶 VBench,开源即屠榜
  4. MoE 创新(2025 中):Wan2.2 首创 MoE 视频生成架构
  5. 音画同步(2025 秋):Wan2.5 对标 Veo 3
  6. 角色扮演(2025 冬):Wan2.6 实现全感官演绎
  7. 全能导演(2026 春):Wan2.7 从"生成工具"进化为"创作系统"

通义万相的成功证明了开源策略在视觉生成领域的巨大威力——通过开放核心模型能力,吸引全球开发者共建生态,最终实现技术迭代与商业落地的双赢。在 AI 视频生成这条赛道上,通义万相已经从"中国版 Sora"成长为真正的全球领跑者。


参考链接

评论