Back

SenseNova U1.5深度解析:去VE/VAE的原生统一多模态,4K图像生成与精准编辑的技术突破

引言

2026年4月,商汤科技发布并开源了 SenseNova U1 系列原生理解生成统一模型,首次完整展示了基于自研 NEO-unify 架构的原生统一多模态路线。四个月后的8月21日,商汤正式开源 SenseNova U1.5 Lite,从"验证架构是否可行"迈向"真实创作场景好用"。

U1.5 不是简单的参数规模升级,而是一次系统性迭代:在保持 8B-MoT 轻量规模的前提下,将能力推进到原生4K生成、精细真实质感、复杂视觉控制和可持续迭代编辑。本文将从架构设计、核心能力、训练技术、性能对比等维度,深度解析 SenseNova U1.5 的技术突破。

一、NEO-unify:最激进的统一架构

1.1 为什么要"去VE/VAE"

当前主流的多模态模型大多采用"拼接式"架构:视觉编码器(VE)负责看图,将图像翻译为语言可理解的特征;变分自编码器(VAE)负责将生成结果编码为潜在表示并解码为像素;语言模型骨干负责理解和推理。这种设计有三个固有问题:

  1. 信息损耗:图像在VE中被压缩为语义特征,纹理、文字笔画、空间结构等精细信息大量丢失,影响生成和编辑的保真度
  2. 协同效率低:理解和生成是两套系统,信息需要在不同组件间多次传递,产生等待、误解和损耗
  3. 扩展瓶颈:为了弥补中间转换的损耗,模型往往需要做得更大才能达到好的效果

商汤的 NEO-unify 架构选择了一条最激进的路线:彻底去除独立的视觉编码器和变分自编码器,重新构建统一的表征空间,并将统一表征融入每一层计算中。

1.2 统一表征如何工作

在 NEO-unify 架构中,语言与视觉信息被作为统一的复合体直接建模。模型不是"先看懂图像、再翻译成文字、再交给另一个系统理解",而是在同一套"思考方式"里直接处理图像、文字等不同信息。

打个比方:传统拼接架构像一个"说不同语言的工作组"——有人专门看图,有人把图像翻译成文字,有人理解文字,有人再把结果翻译成设计指令画图。每完成一次任务,信息都要在不同成员之间来回传递。而 NEO-unify 更像一个从一开始就同时掌握多项技能的人,图像和语言在同一个大脑中自然融合。

这种设计带来的直接好处是:信息流转更快捷、理解更直接、生成更高效,模型不需要依赖单纯堆大参数来弥补中间转换的损耗。

1.3 U1.5 的架构改进

U1.5 在 NEO-unify 基础上做了关键改进:

  • 新增 patch encoding/decoding layers:重新设计了视觉token的编码和解码方式
  • 重新设计生成头:减弱视觉Token网格对最终图像的影响,解决了U1在高分辨率下出现的网格伪影、拼接痕迹和纹理断裂问题
  • 训练扩展至4K分辨率:让模型直接学习高分辨率下的局部细节、复杂空间关系和整体画面一致性

1.4 与BAGEL架构的根本分歧

字节跳动的BAGEL选择了另一条路线:MoT(Mixture-of-Transformers)双塔架构,保留VAE(像素级细节)和ViT(语义级特征)双编码器,通过共享自注意力实现理解和生成的协同。

两种架构代表了统一多模态的两种哲学:

维度 NEO-unify(U1.5) MoT(BAGEL)
视觉编码器 去除 保留(VAE + ViT双编码)
统一程度 最激进,encoder-free 混合,共享注意力但编码双塔
信息保真 统一表征直接建模,减少压缩损耗 双编码兼顾像素细节和语义特征
工程难度 极高,需从零构建统一表征空间 相对可控,可复用成熟组件
扩展方向 图像生成与编辑极致化 世界模型(视频、3D、导航)

二、核心能力:从生成到编辑的全面进化

2.1 原生4K图像生成

U1.5 原生支持4K分辨率图像生成,这在8B量级的统一模型中尚属首次。但商汤强调,4K不只是像素更多,而是对细节、材质、光影和整体一致性的更高要求。

典型案例包括:

  • WAIC发展历程长卷:分辨率4K,长宽比10:3,prompt总长3880词,以中国传统山水长卷的散点透视方式,将上海城市、智慧交通、云计算、智能工厂、大模型、具身机器人、未来城市融合在同一片山河中,放大后文字、图标等细节依然清晰稳定
  • "背包产品解析"信息图:使用1675词超长prompt,包含复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注等复杂约束
  • 商业摄影与产品海报:海岸游客中心建筑概念图、夏日冷萃咖啡广告海报等,呈现真实的材质质感与光影层次

2.2 长上下文视觉控制

U1.5 重点优化了对长篇自然语言和结构化创作指令的理解能力。商汤特别指出一个重要观察:模型的强prompt following能力并非主要来自对结构化模板的记忆或适配。 即使在没有高度依赖专门Prompt Enhance格式化数据训练的情况下,模型依然能稳定执行长篇、多约束、层次化的视觉指令。

商汤认为这体现了原生统一多模态路线的优势:模型学到的不是某种Prompt格式本身,而是从语言描述到视觉结构的原生映射能力

为降低编写门槛,U1.5 还配套了实验性的 Prompt Enhance Skill,能把用户简短想法自动整理成包含主体、布局、风格、文字和各项约束的完整创作方案。

2.3 文字渲染与版式

中英文文字生成一直是开源图像模型的短板。U1.5 在这方面做了显著强化:

  • 中英文文字渲染更准确
  • 复杂版式组织更稳定(杂志内页、旅行攻略、信息图)
  • 多文本排版能力(海报、品牌视觉、信息密度高的内容)
  • 从"生成内容"走向"组织完整视觉表达"

2.4 图像编辑:从"抽卡"到"迭代"

这是 U1.5 最重要的能力升级。传统图像编辑的痛点是:"只想改掉图里的一只杯子,AI却把背景和主角的脸一起换了。"

U1.5 依托原生统一架构,在同一个模型中协同完成视觉理解、目标定位、约束推理与像素生成的全流程,不需要拼接多个独立模型。encoder-free 视觉建模方式减少了固定视觉编码器带来的信息压缩,将文字笔画、局部纹理、空间结构等精细信息保留得更完整。

已覆盖的编辑工作流包括:

1. 参考图风格与设计再创作 看懂参考图中的配色、构图、材质、字体和视觉语言,迁移到新主题。例如青花瓷风格古建筑屋顶图鉴。

2. 多参考图组合编辑 从多张参考图中分别提取人物、产品、场景和风格,完成跨图绑定、内容融合与场景重构。例如水煮鱼菜单与炸鸡融合,创作新菜品菜单。

3. 单参考图条件创作 以单张人物、产品或场景图片为视觉条件,在保持主体身份、外观和关键细节的基础上,生成新的海报、信息图、营销页面。例如人物照片简历排版。

4. 信息图局部编辑 针对标题、数字、图标、标注、图表及内容模块进行定向修改,支持元素增删、位置调整、局部美化和瑕疵修复,"牵一发不动全身"。

5. 文字编辑 对真实场景中的文字进行编辑,保持原有字体、材质、透视、排版与遮挡关系,使文字自然融入原图。

6. 交互式精准编辑 支持区域标记(Bounding Box)、坐标定位、视觉Marker标记等方式,让模型准确理解编辑位置与范围,画个框告诉模型"改这里"。

商汤将这种能力定位为:图像创作从一次性的"重新采样"转向可持续迭代的视觉操作过程。 用户可以在当前结果基础上持续修改文案、调整版式、补充元素,从"一次抽卡、不行重来"变成"反复修改、改到满意"。

三、MOPD:多专家在线策略蒸馏

3.1 要解决什么问题

统一模型需要同时做好文字渲染、美学质量、编辑保持等多个维度。如果用单一模型训练,不同能力之间可能相互干扰;如果用多个专家模型分别训练,部署时又需要Router频繁切换,增加系统开销和推理时延。

3.2 MOPD的工作方式

U1.5 正式版采用了 多专家在线策略蒸馏(Multi-Expert Online Policy Distillation, MOPD) 技术:

  1. 训练阶段:针对文字、美学、编辑等不同维度,分别独立训练专家模型(Expert),每个专家在自己擅长的维度上做到极致
  2. 交付阶段:通过在线策略蒸馏,将多个专家的能力无损融合到单体8B模型中
  3. 推理阶段:无需Router切换,单次Pass即可兼顾语义理解与像素生成

这一技术使得8B-MoT的轻量模型能够同时在多个维度上达到高水准,同时保持极低的部署成本和推理延迟。

3.3 后训练强化

正式版还强化了任务导向的强化学习(RL)后训练,聚焦优化指令遵循(Instruction Following),让模型更准确地执行用户的完整意图,而非只生成"看起来好看"的图。

四、Benchmark性能

U1.5 Preview 相比 U1 在主流生成/编辑评测基准上的提升:

Benchmark U1 U1.5 Preview 提升幅度
Qwen-Image-Bench 47.14 55.20(with Prompt Enhance) +8.06
ImgEdit-Bench 3.90 4.37 +0.47
GEdit-Bench-en 7.47 8.17 +0.70
GEdit-Bench-zh 7.42 8.05 +0.63

以仅8B-MoT的轻量规模,U1.5在指令遵循和编辑保持方面超越同规模模型,在文字渲染和复杂布局方面与大型商业模型(Qwen-Image 2.0 Pro、Seedream 4.5等)竞争。

五、参数量与硬件要求

5.1 "8B"的真相

需要注意,命名中的"8B-MoT"并非总参数量:

  • 视觉理解部分:约8B参数
  • 图像生成部分:约8B参数
  • 总参数约17.5B-18B(Hugging Face显示)
  • bf16模型体积:约35-36 GB

5.2 硬件配置建议

硬件配置 体验
A100/H100 40GB+ 追求速度和体验的推荐配置
32GB显存 + 优化 可流畅运行
RTX 4090 24GB 普通玩家较舒适
16GB及以下 GGUF + balanced/low模式可跑,速度较慢

六、开源与生态

6.1 开源信息

  • 协议:Apache 2.0(商用友好)
  • GitHub:github.com/OpenSenseNova/SenseNova-U1
  • Hugging Face:huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
  • 魔搭社区:modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
  • 已放出 8-step LoRA
  • 后续计划公开从 SFT、RL 到 MOPD 的完整训练Pipeline

6.2 国产芯片适配

U1系列发布后,壁仞科技、寒武纪、昆仑芯、摩尔线程、中科海光等10家国产芯片公司已完成Day 0适配。U1.5延续了这一生态优势。

6.3 U1 Pro预告

商汤同时预告,面向专业用户的交付级创作模型 U1 Pro 正在紧密邀测,将在近期对公众开放服务。这意味着U1.5 Lite只是轻量版,后续会有更大规模、更强能力的版本。

七、行业定位与竞争格局

7.1 U1.5的差异化定位

U1.5 选择了一条非常聚焦的路线:不做视频,不做世界模型,把所有筹码压在图像生成和编辑的极致可控性上。

这与其他统一模型形成了鲜明差异:

模型 核心定位 视频 3D/世界模型 图像编辑
SenseNova U1.5 专业视觉创作工具 暂不支持 暂不支持 核心强项
BAGEL(字节) 世界模型 帧预测/导航 多视图/3D 支持
Janus-Pro(DeepSeek) 轻量统一理解+生成 不支持 不支持 基础
Emu3(智源) 纯AR统一范式 支持 不支持 基础

7.2 为什么不做视频

商汤的选择有其逻辑:当前统一模型在视频生成上的质量远不及专用视频模型(Sora、可灵、Veo),而图像生成和编辑是已经可以产品化、商业化的能力。与其分散精力做质量不达标的视频,不如先把图像创作做到极致,再逐步扩展。

MOPD技术也暗示了这种扩展路径——先在图像域训练多个专家并蒸馏到统一模型,未来可以将视频专家、3D专家以同样方式融合进来。

7.3 对设计工作流的影响

U1.5 最值得关注的不是benchmark分数,而是它对真实创作工作流的改变:

  • 告别Prompt工程焦虑:大白话也能出好图,复杂需求写得越细越准
  • 告别单次抽卡:生成后可以持续迭代修改,而非不行重来
  • 降低专业设计门槛:信息图、海报、品牌视觉等复杂设计任务,一个模型完成从理解到生成到编辑的全流程
  • 本地化部署可能:8B规模在24GB消费级显卡上可跑,对中小团队和个人创作者友好

八、总结与展望

SenseNova U1.5 的发布标志着原生统一多模态路线从"技术验证"进入"产品交付"阶段。

它的核心贡献可以概括为三点:

  1. 架构层面:证明了去VE/VAE的encoder-free统一架构不仅可行,而且能在8B轻量规模下持续扩展到4K分辨率和精细编辑能力
  2. 工程层面:MOPD多专家蒸馏技术解决了统一模型多能力协同与部署效率的矛盾,为后续能力扩展提供了可复用的工程范式
  3. 产品层面:将图像编辑从"外挂功能"变为统一模型的原生能力,推动AI视觉创作从"一次抽卡"走向"持续迭代"

当然,U1.5也有明确的局限:目前仅支持图像,不涉及视频和3D;8B-MoT的规模在复杂推理能力上与更大模型有差距;4K生成对硬件要求仍然不低。

但商汤已经给出了清晰的路线图:U1 Pro即将到来,MOPD为视频/3D专家的融合预留了架构空间。如果NEO-unify架构能持续证明"能力可以不断扩展到统一模型中",它有可能成为统一多模态领域的一条主流路线,与BAGEL的MoT路线形成长期竞争。

未来的多模态模型不应只是连接不同模态的系统,而应该是一个从一开始就能跨越语言、视觉与行动进行学习、思考和创造的统一智能体。SenseNova U1.5 正在朝这个方向迈出扎实的一步。

评论