SenseNova U1.5技术报告:迈向原生统一视觉智能
我们推出 SenseNova U1.5,一个采用 8B-MoT 架构的原生统一多模态模型,无需外部视觉编码器和变分自编码器(VAE),即可理解、推理和生成视觉内容。我们通过保持图像块间空间连贯性的重建方式改进视觉接口,结合精选的生成与编辑数据、改进的任务建模、结构化提示增强及最高 4K 原生分辨率训练,扩大训练规模。后训练阶段,我们分别优化视觉美学、双语文字渲染、信息图生成和图像编辑专家,再通过多专家同策略蒸馏整合其能力。
全面评测表明,SenseNova U1.5 在图像保真度、文字渲染、复杂构图、多参考图编辑和交错生成方面均取得显著进展,同时提升指令遵循能力,保持主体身份特征、几何结构与非编辑区域的一致性。尽管生成训练数据对结构化格式的覆盖有限,模型仍能有效泛化到长而复杂的结构化视觉指令,进一步证明多模态理解能力能够迁移至视觉规划与创作。
这些结果表明,原生统一建模为构建集感知、推理与创作于一体的端到端系统提供了一条有前景的路径。我们将开源包括监督微调、强化学习和同策略蒸馏在内的训练代码。代码及更多模型信息:https://www.sensenova.cn/
SenseNova U1.5技术报告链接(欢迎社区关注):https://huggingface.co/papers/2609.11929
商汤小浣熊在线体验:https://office.xiaohuanxiong.com/
Hugging Face 模型:https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova U1.5 评测概览

图1 SenseNova U1.5 在信息图与人物生成方面的示例。

图2 SenseNova U1.5 在图像编辑与多参考图生成方面的示例。
1 引言
近年来,视觉生成正迅速超越传统的图像合成,演化为一种通用的视觉创作媒介,覆盖多语言文字排版、信息密集型设计、高分辨率渲染、多参考图组合、细粒度对象与背景编辑,以及交错生成。然而,这一范围的拓展也暴露出架构层面的割裂:大多数系统通过预训练视觉编码器(vision encoders,VEs) 感知图像,却通过变分自编码器(VAEs) 生成图像。因此,理解与生成在不同的表示空间中运行:前者针对语义抽象进行优化,后者则针对像素级保真度进行优化。尽管这种分离方式是有效的,但它限制了感知、推理与生成在统一视觉框架中、面向多种视觉创作形式进行无缝协同的程度。
原生统一建模选择了另一条路线,即直接从像素与文本中学习。SenseNova U1 通过不依赖外部编码器和 VAE 的 NEO-unify 架构,验证了这一范式的可行性,将感知、推理与像素空间生成纳入同一个端到端模型。然而,其有意采用的轻量化视觉接口将每个视觉 token 重建为独立的 RGB 图像块。尽管这一方式效率较高,但这种因子化处理使图像形成的最后阶段无法在相邻图像块之间交换信息,导致接缝、纹理不连续和几何不一致在高分辨率下愈发明显。
本文提出 SenseNova U1.5,一个用于视觉理解、推理与生成的 8B-MoT 原生统一多模态模型。其核心首先在于一项重要的架构转变:从独立的图像块预测转向空间联合重建。我们不再将各个视觉 token 彼此孤立地映射为像素,而是将 token 投影到二维特征场中,并通过空间卷积和 Pixel Shuffle 上采样逐步重建图像。这使相邻区域能够在像素最终确定之前交换信息,从而联合确定颜色、纹理与几何结构,而非逐块独立处理。由此形成的设计既保留了紧凑视觉序列的效率,又显著改善了空间一致性,并支持最高达 4K 分辨率的原生生成。
第二项重要进展是从联合奖励优化转向“先专精、再统一”的策略。视觉创作涵盖本质上不同的能力,包括面向视觉美学的图像生成、双语文字渲染、信息图设计和图像编辑;每种能力都有不同的奖励信号、采样轨迹动态和优化难点。在单一策略中联合优化这些能力,可能使相互竞争的目标纠缠在一起,稀释任务特定的收益。因此,我们先进行专门化,再实现统一:针对不同能力,使用定制的数据、奖励、采样策略和正则化方法,分别优化专门的强化学习(reinforcement learning,RL)专家,随后通过多专家同策略蒸馏整合它们的互补优势。这一过程沿学生模型自身的生成轨迹实施蒸馏,在保留专家互补优势的同时,将其能力迁移到一个统一策略中。
广泛的评测进一步表明,单一的原生视觉表示能够成为理解、推理、生成和编辑共享的基础,无需并行的视觉处理路径,也无需在编码器特征与 VAE 潜变量之间反复转换。尽管每个 32×3 像素区域都被压缩为一个视觉 token,这种紧凑表示仍能支持高效推理,并在图像保真度、双语文字排版、复杂构图、多参考图编辑、交错生成、指令遵循、视觉内容保持及细粒度控制等方面取得出色表现。更引人注目的是,尽管训练对固定生成模板的依赖有限,SenseNova U1.5 仍能够泛化到较长、具有组合性且高度结构化的视觉指令。这表明,通过多模态理解与推理获得的结构知识和规划能力,能够自然迁移到视觉创作中。综合而言,这些结果说明,原生统一不仅仅是架构层面的简化:紧凑的共享视觉表示能够高效支持“看”与“创作”,并使通过一种视觉智能形式学到的能力增强另一种能力。
2 相关工作
2.1 图像生成数据原生统一多模态模型
原生视觉语言模型(vision-language models,VLMs)直接处理视觉输入,不依赖外部编码器。Fuyu-8B、EVE、Mono-InternVL、NEO、Gemma4-12B 和 Inkling 等模型已逐步缩小与领先模块化 VLM 的性能差距。视觉生成领域也出现了平行的发展趋势:近期工作直接对像素进行建模,证明高保真合成并不一定需要依赖高度压缩的潜在空间。在这些进展的基础上,原生统一多模态模型越来越多地尝试在同一框架内融合理解与生成。其中,离散原生模型通过 token 级自回归统一多模态学习,而连续原生方法则探索不依赖显式分词器或潜在瓶颈的端到端建模。基于 NEO-unify,我们的 SenseNova-U 系列进一步拓展了这一方向,迈向一个完全原生的基础架构,使理解、推理和生成从共享的视觉基础中涌现。
2.2 面向扩散模型的强化学习
在语言建模中,基于人类反馈的强化学习(reinforcement learning from human feedback,RLHF)建立了一种通用的后训练范式:由学习得到的奖励引导策略优化,并通过 PPO 相对于参考策略稳定更新。值得注意的是,GRPO 和 DAPO 通过移除显式价值模型、引入组内相对优势及改进的在线优化策略,提升了效率与可扩展性。在线强化学习也已扩展到视觉生成领域:ReFL、DDPO 和 DPOK 通过偏好奖励或策略梯度优化扩散模型,而 AlignProp 和 D3PO 则提高了效率,并减少了对显式奖励模型的依赖。近期,Flow-GRPO 与 DanceGRPO 将组内相对优化扩展至扩散模型和流匹配模型,改善了偏好对齐、组合准确性、文字渲染与视觉质量。
对于流匹配模型,在线强化学习需要在确定性的常微分方程(ordinary differential equation,ODE)推理之外引入随机探索。Flow-GRPO 通过基于随机微分方程(stochastic differential equation,SDE)的采样轨迹实现这种探索;系数保持采样(coefficients-preserving sampling,CPS) 和 Precise 则通过更好地保留底层流动态、平衡探索与分布保真度,改善有限步采样。除采样之外,GRPO-Guard 通过受控裁剪和噪声感知梯度重加权,缓解奖励过度优化。现有视觉强化学习还依赖能力特定的奖励,包括评估感知质量和文图对齐的偏好模型,以及针对文字排版和编辑的专用奖励。受这些进展启发,我们采用依任务而定的强化学习后训练,将 CPS 或 Precise 采样与交替使用的奖励或任务特定奖励相结合,以满足生成和编辑不同的优化需求。
2.3 面向统一模型的同策略蒸馏
近期,同策略蒸馏(on-policy distillation,OPD) 通过让学生在自身生成的轨迹上接受教师的密集监督,缓解了传统知识蒸馏中的分布不匹配问题。在这一范式基础上,MOPD 将 OPD 扩展到多教师能力整合:由独立优化的领域专家监督学生的同策略采样轨迹,从而将多种推理能力整合到单一模型中。在语言建模之外,OPD 也已被用于多模态理解与推理,由教师监督学生生成的多模态轨迹。其应用近期还扩展到了视觉生成。具体而言,Flow-OPD、DiffusionOPD 和 DanceOPD 分别利用教师一致性信号、转移匹配和速度场回归,沿学生生成的去噪轨迹蒸馏任务专门化生成器。此外,DiffusionOPSD 则移除了外部教师,利用可微奖励梯度构造有界的自蒸馏目标。我们的设置与这些方法形成互补:我们不强行让所有任务采用同一套蒸馏方案,而是保留四个任务专门化的外部专家,通过硬路由将其监督信号送入同一个原生像素空间模型。这一设计在整合专门化能力的同时,保留了各专家依任务而定的条件输入、引导方式和分辨率策略。
3 方法
3.1 模型架构
近无损视觉接口。 SenseNova U1.5 保留了 NEO 提出的轻量级原生视觉接口,将原始图像或加入噪声的视觉输入直接变换为紧凑的 token 序列,无需外部视觉编码器或 VAE。具体而言,两个带有 GELU 激活的卷积投影分别执行 16 倍和 2 倍下采样,使每个 32 × 32 图像区域对应一个视觉 token。二维正弦位置嵌入保留空间坐标,而特殊 token 和用于界定各个视觉块。文本使用原始语言分词器进行分词,随后将视觉与文本表示投影到共享隐藏空间,由统一主干网络联合处理。这种设计在保留近无损视觉信息的同时,使序列长度保持在大规模多模态建模可处理的范围内。

图 3 SenseNova U1.5 概览。与 SenseNova U1 相比,U1.5 在编码和解码两端进一步改进了近无损视觉接口:分辨率感知噪声条件扩展到 4096 × 4096 范围,原始逐图像块 MLP输出头被采用 Pixel Shuffle与 3 × 3 卷积的轻量级空间解码器替代。这些改进保留了每个 32 × 32 像素区域对应一个视觉 token的紧凑表示方式,同时增强空间连续性、高分辨率保真度和下游鲁棒性。

表 1 SenseNova U1.5 的配置。模型采用较高的空间压缩比、Pre-Buffer 设计、用于统一时空编码的原生 RoPE,以及联合进行多模态理解与生成的 Mixture-of-Transformers 架构。
对于生成任务,有效噪声幅度会随图像分辨率变化,因此,分辨率也是去噪过程的重要条件。SenseNova U1.5 显式引入依赖分辨率的噪声尺度嵌入,并将参考图分辨率从 2048 X 2048 扩展至 4096 X 4096,以更好地支持原生高分辨率生成。模型对相应的噪声尺度进行归一化和编码,再与扩散时间步表示融合,使去噪器同时感知当前去噪阶段和分辨率相关的噪声特征,从而更稳定地适应不同分辨率与宽高比。
紧凑的图像块划分降低了图像建模成本,但通过 MLP 独立解码每个图像块,容易破坏局部连续性,在高分辨率下产生接缝、网格伪影和纹理不连续。为此,SenseNova U1.5 用轻量级空间耦合解码器替换原有的 MLP 输出头。如图 3 所示,解码器首先将主干网络输出的视觉 token 恢复为二维特征图,再通过三级 Pixel Shuffle 上采样逐步重建全分辨率 RGB 图像。各级之间的局部卷积使相邻区域能够交换信息,共同确定图像块边界附近的像素,而不是逐块独立预测。
该解码器在像素合成前恢复局部空间交互,使全局语义、构图与细粒度结构能够在同一端到端框架内联合优化。它与主干网络在流匹配目标下共同训练,仅增加少量计算开销,就能改善跨图像块一致性与局部连续性,减少边界伪影,并提升高分辨率生成和下游适配的稳定性。
原生 Mixture-of-Transformers。 SenseNova U1.5 保留了原生 Mixture-of-Transformers(MoT)设计,在同一个 Transformer 主干网络中整合理解与生成,而不是将二者完全拆分为两个独立网络。干净的图文上下文与噪声条件化视觉状态在统一序列中交错排列,使语义表示、视觉证据和生成动态能够通过共享自注意力直接交互。这种设计使生成过程能够持续利用多模态理解过程中形成的表示,无需引入辅助融合模块或跨空间特征转换。
注意力模式经过结构化设计,以协调因果语言建模与双向视觉交互。文本 token 仅关注此前的上下文;每个干净图像块内部的 token 则进行双向注意,以捕捉空间依赖。噪声条件化的生成 token 同样在其图像块内部双向交互,并关注此前全部干净的多模态上下文。反向路径被显式掩蔽,防止干净表示访问随机生成状态。这种非对称信息流使生成过程能够利用丰富的语义和视觉上下文,同时保持用于理解与推理的表示的完整性。
关键在于,架构统一并不意味着所有位置都共享参数。理解与生成保留独立的注意力投影、归一化层和前馈模块,并在每一层 Transformer 中按照 token 类型进行动态路由。因此,共享注意力充当跨流通信的接口,而流特定参数保留了感知与合成所需的不同计算。这种密集交互与参数专门化的结合,使两种能力都能受益于共同的表示空间,而不必将各自不同的优化目标强行压入同一条计算路径。
统一训练目标。 SenseNova U1.5 将自回归语言建模、像素空间流匹配与感知监督结合,在同一模型中联合训练理解与生成能力。
对于多模态理解,模型根据已有的图文上下文和此前的文本,依次预测后续文本 token,通过提高正确预测的概率,学习语义理解与多模态推理。
对于视觉生成,模型直接在 RGB 像素空间中学习从噪声到图像的连续转换。训练时,将真实图像与按目标分辨率调整幅度的高斯噪声混合,构造不同生成阶段的带噪状态。模型从这些状态预测干净图像,并据此估计生成轨迹的变化速度,再通过流匹配损失缩小预测速度与目标速度之间的差异。
在此基础上,模型引入 LPIPS 感知损失,在特征空间中比较预测图像与真实图像,进一步约束结构一致性、局部纹理和视觉连贯性,补充像素空间的监督信号。三类损失按权重组合并联合优化,使语义理解、图像生成与视觉质量约束相互配合,让高层语义与底层视觉生成在统一表示中共同学习。
3.2 训练流程
SenseNova U1.5 逐步构建原生多模态能力,依次经历生成预训练、统一中期训练和统一监督微调(阶段 1—3),具体设置见表2。之后,再进行能力特定学习(阶段 4)与多专家同策略蒸馏(阶段 5)。

表 2 SenseNova U1.5 的训练方案。
阶段 1:生成预训练。 在预训练理解分支的基础上,我们随机初始化生成分支,并以冻结的理解分支提供的表示为条件,通过像素空间流匹配训练生成分支。SenseNova U1.5 增加了计算预算,并引入专门的原生 4K 训练阶段。训练首先使用分辨率从 256×256 到 1024×1024 的文生图数据。在这一阶段,我们以 2×10-4的恒定学习率训练 180K 步,序列长度为 8,196。随后,将文生图数据扩展至 512×512 到 4096×4096 的更高分辨率,以增强模型的原生 4K 生成能力。这一阶段以 1×10-4的恒定学习率训练 100K 步,并将序列长度增加至 20,480。在最后一个阶段,我们引入图像编辑与交错生成任务,继续训练 185K 步,将模型的生成能力拓展到多种下游场景。训练混合数据中,60% 为文生图数据,30% 为图像编辑数据,10% 为交错图文数据。我们采用余弦学习率调度,将学习率从 1×10-4衰减至 2×10-5,序列长度维持为 20,480。从这一阶段开始,我们在流匹配目标之外增加基于 LPIPS 的感知损失,其权重为 0.1,以改善细粒度视觉细节的生成与局部视觉连贯性。值得注意的是,这一组合生成目标在后续统一中期训练和监督微调阶段中保持不变。
阶段 2:统一中期训练。 我们联合优化两个分支,共享注意力促进跨分支信息交换,同时保留任务特定表示。为平衡通用多模态能力与多样化生成能力,我们构建混合语料,其中 30% 为纯文本及多模态理解数据,40% 为文生图数据,20% 为图像编辑数据,10% 为交错图文数据。这种混合使模型能够在统一训练阶段接触感知、合成、编辑与多模态交互等互补形式。模型训练 80K 步,最大序列长度为 32,768 个 token,恒定学习率为 2×10-5 。理解损失和生成损失的权重分别为 0.1 和 1.0。这一权重设置有助于保留预训练理解能力,同时将更大的优化权重赋予更具挑战性的生成目标,从而实现稳定的联合训练与更有效的能力整合。
阶段 3:统一监督微调。 我们进一步使用精心筛选的高质量指令遵循数据对模型进行微调,任务构成与阶段 2 相近。这一阶段进一步增强指令遵循,并将早期训练获得的能力巩固到统一模型中。训练进行 10.5K 步,采用余弦学习率调度,将学习率从 2×10-5衰减至 0,同时保留与阶段 2 相同的损失系数,以维持理解目标与生成目标之间的平衡。

图 4 SenseNova U1.5 的后训练流程,包括多专家强化学习与同策略蒸馏。
阶段 4:多专家强化学习。如图 4 所示,我们分别训练美学、文字渲染、信息图生成和图像编辑四个专家,每个专家采用任务特定的数据、奖励、采样与正则化设置。
(1)美学专家。仅优化视觉偏好可能会改善整体外观,却牺牲文字可读性。因此,我们在不同训练轮次(epoch)之间交替使用美学偏好数据与文字排版数据来训练美学专家。各数据分区的样本被路由至任务特定奖励:HPSv3++ 评估感知质量及提示与图像的对齐程度,基于 PaddleOCR 的双语 OCR 奖励则衡量文字保真度。这种路由避免了将尺度与语义不同的奖励混合在一起,同时在偏好优化过程中保留文字排版准确性。
对于每条提示,我们使用 30 步轨迹生成 16 个候选结果,引导尺度为 4.0,时间步偏移为 3。我们采用 η = 0.7的系数保持采样(CPS),在引入随机探索的同时减少传统 SDE 采样带来的有限步伪影。
每次更新时,我们从轨迹的前 10 步中均匀采样一个连续 5 步的窗口,将优化集中在主要决定全局内容与构图的早期去噪阶段。训练采用动态分辨率和宽高比,恒定学习率为 2×10-5,参考策略 KL 系数为 0.01。为减少奖励引发的漂移,我们在强化学习过程中冻结生成分支最后一个 Transformer 块、流匹配输出头及其输出归一化层。
(2)OCR专家。OCR 专家专门提升模型准确渲染双语文字的能力。对每条提示,我们提取预期出现在图像中的文字作为目标,并使用 PaddleOCR 识别生成内容。随后,在识别文字与目标文字之间计算归一化多重集交并比:英文按词匹配,中文按字符匹配。与完全匹配相比,这种分级奖励能够更好地反映部分正确的生成结果,同时仍对遗漏、重复和渲染错误保持敏感。
我们为每条提示生成 16 个候选结果,采用 30 步轨迹,引导尺度为 4.0,时间步偏移为 3,并从前 10 步中采样一个连续 5 步的优化窗口。轨迹采样采用系数为1.5的 Precise 采样,同时使用 GRPO-Guard 在高 OCR 奖励稀疏的情况下稳定优化。训练采用动态分辨率和宽高比,恒定学习率为 2×10-5,参考策略 KL 系数为 0.02。我们同样在强化学习期间冻结生成分支最后一个 Transformer 块、流匹配输出头及输出归一化层。
(3)编辑专家。有效的图像编辑需要平衡三个目标:指令遵循、未编辑内容的保持,以及编辑区域的视觉质量。编辑不足可能导致指令仅被部分执行,过度编辑则可能改变应保持不变的内容。因此,编辑专家必须学习应修改什么、应保留什么,以及如何将所要求的改动自然地融入源图像。
编辑专家采用 4×10-5 的恒定学习率、0.01 的 KL 系数、24 的轨迹采样组大小,以及 0.7 的噪声尺度,并使用指数移动平均(exponential moving average,EMA)。我们避免基于 SDE 的轨迹采样,因为过强的随机扰动可能引入残余噪声和视觉伪影。在这一设置下,我们进一步引入两项编辑专用策略,以提供有针对性的奖励监督,并提高优化效果。
(i)多维奖励。我们使用基于 VLM 的奖励框架,从五个维度评估编辑质量:指令完成度、编辑执行、整体视觉质量、适用情况下的文字编辑质量,以及未编辑区域的保持情况。这些互补信号针对不同失效模式提供定向监督,同时平衡编辑准确性、视觉保真度和内容保持。
(ii)渐进式训练。我们采用渐进式滑动窗口策略,将优化重点从建立语义的早期阶段,逐步移动到细化纹理的后期阶段。这种由粗到细的推进方式先确保预期结构变化,再改善局部保真度及其与周围内容的视觉融合。
(4)信息图专家。信息图生成需要准确的文字渲染、连贯的密集布局、清晰的信息层级和较高的整体视觉质量。信息图专家首先经历从面向信息图的中期训练到任务特定强化学习的完整训练流程,旨在更显著地改善小字号文字渲染及相关能力。在中期训练中,我们引入高质量真实数据和合成数据,并重新平衡信息图子类别之间的分布,以及信息图数据与其他类别数据的混合比例。这进一步改善了小字号文字渲染、复杂布局处理、信息组织和整体视觉设计质量。
随后,我们通过三个阶段进一步优化信息图专家。第一阶段采用与 OCR 专家相同的训练数据和文字保真度奖励,改善文字渲染。第二阶段对精心筛选的偏好对应用直接偏好优化(direct preference optimization,DPO),以提高整体视觉质量;恒定学习率为 5×10-6 ,DPO 损失系数为10,每次更新从第 1—20 步中采样一个时间步。最后一个阶段交替使用文字渲染数据和美学数据,分别将其路由到文字保真度奖励与 HPSv3++,而不是合并两个分数。
第一阶段和最后阶段均采用组相对策略优化(group relative policy optimization,GRPO),使用系数保持采样(CPS),在 30 步轨迹上为每条提示生成 16 个候选结果。无分类器引导仅在为奖励评估收集采样轨迹时使用,而策略目标仅由条件预测计算。两个阶段的恒定学习率均为 2×10-5 ,参考策略 KL 系数均为 0.01。
阶段 5:多专家同策略蒸馏。如图 4 所示,我们采用同策略速度场蒸馏,将美学、文字渲染、信息图生成和图像编辑四个专家的能力整合到单一统一模型中。每个训练样本根据所属能力类别,被分配给对应的冻结专家。学生模型先根据文本或图文条件生成自己的去噪轨迹,再由学生与专家在相同的中间状态、时间步和输入条件下分别预测生成过程的变化速度。训练通过最小化两者速度预测的平方误差,将专家能力传递给学生。
在这一过程中,所采样的中间状态被视为固定输入,梯度不会沿完整采样轨迹反向传播。每个训练轮次只使用一种能力的数据及其对应专家,并按固定顺序轮换。
文生图和图像编辑均采用固定 30 步的确定性常微分方程(ODE)去噪,每条轨迹只选取一个时间步查询专家。查询位置按照随训练轮次变化的 Beta 分布进行抽样:训练初期更关注轨迹前段的高噪声状态,以学习全局结构;随后逐步转向后段的低噪声状态,强化细节与文字保真度。为保持训练和推理一致,我们直接优化无分类器引导(CFG)下的速度预测。美学、OCR 和信息图专家的引导尺度为 4,并使用全局范数裁剪;编辑专家的引导尺度为 1。
对于文生图,我们首先从 10242,15362,20482,30722,40962中选择目标面积,并从 1:1,16:9,9:16,4:3,3:4,3:2,2:3,1:2,2:1 中选择目标宽高比。在保持目标面积的前提下计算宽高,并将尺寸取整至最接近的 32 像素倍数。图像编辑则沿用源图像分辨率,仅进行相同的尺寸取整。
学生模型共训练 800 个优化器步,全局批大小为 128,梯度累积次数为 1,每个领域使用 25,600 个样本。训练采用 AdamW 优化器,学习率为,一阶和二阶矩估计的衰减系数分别为 0.9 和 0.999,权重衰减为 2×10-5,最大梯度范数为 1,并使用 BF16 混合精度。理解分支、生成分支最后三层及生成输出头保持冻结。采样按照 30 步轨迹设置进行,但在完成选定的查询转移后立即终止,避免计算后续不会使用的轨迹。
3.3 奖励建模
美学奖励。美学质量综合反映构图、视觉保真度、语义一致性、风格连贯性和人类偏好,难以通过人工设计的单一目标充分刻画。因此,我们使用 HPSv3++ 提供偏好奖励。其训练方式同时考虑模型能力差异和迭代过程,适用于生成质量持续提高、输出分布不断变化的强化学习后训练。相比基于固定生成分布训练的评分器,它能够提供更稳健、更具适应性的偏好监督,帮助模型改善感知质量,减少对狭窄奖励目标的过拟合。
OCR奖励。仅依赖偏好奖励不足以保证文字正确,因为视觉上合理的图像仍可能存在文字缺失、重复或字形错误。我们因此引入显式 OCR 奖励:从提示中提取目标文字,使用 PaddleOCR 识别生成图像,并对大小写、标点和空白进行归一化处理。英文按词切分,中文按字符切分。
评分采用多重集交并比。对于每个词或字符,分别统计其在目标文本和识别文本中的出现次数,将较小次数计入匹配量、较大次数计入总量,再以汇总后的匹配量占总量的比例作为奖励。这种方式奖励正确出现的文字,同时惩罚遗漏、额外生成和重复错误,也能更稳健地应对密集或多区域布局中不可靠的 OCR 阅读顺序。
在后训练中,美学提示与 OCR 提示分别使用各自的奖励,并在训练轮次之间交替使用,避免在单个样本中混合尺度不同的奖励。
信息图奖励。我们没有引入额外的信息图专用奖励模型,而是根据训练阶段与任务类型,复用 OCR 奖励和美学奖励。第一个训练阶段仅使用 OCR 奖励进行预热,优先提高文字保真度;最后一个训练阶段则按提示所属类别分配奖励:文字渲染提示使用 OCR 奖励,美学提示使用 HPSv3++。
两类分数不相加,也不相互归一化。这种任务路由保留了各自的尺度与语义,同时为文字准确性和感知质量提供互补监督。
编辑奖励。图像编辑的奖励不仅需要判断所要求的改动是否完成,还要评估结果是否在视觉上可信,以及与编辑无关的源内容是否得到保留。单一整体评分可能掩盖不同类型的错误,让某一方面的优势抵消另一关键方面的失误。因此,我们采用多个维度分别评估编辑质量。
其中,指令完成度衡量编辑结果的语义正确性及所要求改动的完整程度;编辑执行质量评估目标区域的视觉质量及其与周围内容的自然融合程度;整体视觉质量考察全局技术质量和预期风格的一致性;文字编辑质量在涉及文字修改时,评估文字正确性与渲染质量;未编辑区域保持则比较源图像与编辑结果,惩罚目标区域之外非预期的语义、结构或视觉变化。
对于包含多个子维度的评估项,我们保留其中的最低分。各项评分归一化后,最终奖励取所有适用维度中的最低值,而不是平均值。不涉及文字修改时,不纳入文字编辑评分;当图像中看不到任何所要求的变化时,编辑执行分数设为 0。
这种以最弱项决定整体奖励的方式,避免某个维度的高分掩盖其他维度的关键错误,使奖励始终对编辑不完整、非预期修改和局部质量缺陷保持敏感,为图像编辑强化学习提供更均衡、更可靠的监督。

图 5 SenseNova U1.5 的训练语料。从左至右,图表依次展示图像生成、图像编辑、交错生成和强化学习训练数据集的层级构成。内环表示主要数据类别及其比例,外环进一步分解为细粒度子类别。
4 数据构建
如图 5 所示,SenseNova U1.5 在 SenseNova U1 的基础上大幅扩展了训练语料,重点增强数据多样性、视觉质量、高分辨率生成、复杂指令遵循与细粒度图像编辑能力。除扩大数据规模外,我们还通过质量感知筛选、分布再平衡、更强的图文对齐,以及针对覆盖不足能力的定向合成,系统性地改进数据筛选与整理。
4.1 图像生成数据
图像生成语料结合了大规模真实世界图文对、精心筛选的公开及专有来源,以及高质量合成数据。与 SenseNova U1 相比,我们新增了来自 78 个来源的约 5,900 万组文图对,显著拓宽了训练分布,覆盖通用场景、以人物为中心的内容、对象与材质、富文本图像、信息图及其他专门视觉领域。
重要的是,高分辨率样本在整体训练混合中占据很大比例:有效训练量中,约 88.2% 的分辨率超过 10242,约 64.4% 超过 20482。这使模型能够接触多种空间尺度下丰富的视觉统计信息,不仅为全局连贯的场景构图与布局提供监督,也为细粒度局部结构、纹理、材质及其他高频视觉细节提供监督。
为改善指令对齐,我们构建了不同粒度的图像描述,从长篇详细描述,到简短图注和轻量级语义标签。我们进一步加强中英双语覆盖,尤其是富文本图像,并显式核验提示所指定的语言与文字是否与图像中实际渲染的内容一致。为补充真实世界数据,我们收集网络规模的数据,并针对罕见概念、复杂布局和文字密集型设计开展定向合成。合成样本与真实样本均通过同一套筛选流程,联合评估感知质量、提示保真度、文字正确性、布局质量和视觉多样性,以确保训练分布具有较高质量且保持均衡。
4.2 图像编辑数据
我们的图像编辑语料包含约 3,800 万个样例,旨在覆盖四种互补设置:通用图像编辑、信息图编辑、参考条件编辑,以及空间可控编辑。这些设置共同覆盖广泛的编辑场景,包括局部属性修改、对象插入与移除、场景级变换、姿态和动作编辑、修复与增强、文字和布局操作、参考引导的定制化,以及区域受控操作。为提升对固定指令模式之外情况的鲁棒性,我们同时丰富底层视觉内容,以及编辑指令的表述方式、粒度和复杂度。对于具有挑战性的多目标或多约束编辑,我们进一步纳入结构化提示增强样例和思维链样例,显式刻画编辑意图、目标区域、期望属性、空间或语义约束,以及应保持不变的内容。这种结构化监督减少了指令歧义,并为精确、忠实且重视内容保持的编辑提供更强引导。
该语料约 43% 为通用编辑,约 42% 为空间可控的信息图编辑样例,另有约 15% 的参考条件子集,同时支持单参考图和多参考图编辑。信息图数据结合了程序化渲染的源图—目标图对,以及模型生成的样例,使文字、视觉元素、布局结构和整体风格能够得到精确操控。参考条件数据强调主体和身份保持、属性迁移、组合融合,以及视角、姿态、几何结构和光照等方面的可控变换,每个样例最多包含 10 张参考图。空间可控数据进一步通过边界框和视觉标记引入显式区域级引导,支持更精确、更具交互性的操作。在所有编辑设置中,数据筛选均联合评估指令完成度、目标质量、适用情况下的参考或身份保真度,以及预期编辑区域之外内容的保持情况。
4.3 图文交错数据
语料中占比最大的是面向日常生活的轨迹(约 44%),包括步骤式教程、日常场景和绘本叙事。这些样例为交替出现的文本与图像片段之间维持长程语义连贯性、视觉一致性及跨模态依赖提供丰富监督。信息图数据另占约 29%,侧重结构化构图、密集文字内容,以及语言与视觉元素的协同生成。由视频衍生的序列约占 19%,引入时间演化、状态转移和跨帧依赖。其余约 8% 为推理密集型样例,通过显式中间推理加以增强,用于复杂的多步理解与生成。
我们并不将这些来源视作彼此孤立的任务集合,而是将它们转换为一种统一轨迹格式,在其中逐步交错排列文本状态与视觉状态。这种统一表述使模型能够接触广泛的多模态依赖,从局部图文对应,到长程语义推进、时间连续性,以及跨多步的推理条件化生成。值得注意的是,所有轨迹都通过一套共享流程构建,该流程结合源数据预处理、领域特定转换或合成,以及轨迹级验证。最终语料从语言有效性、视觉质量、跨模态一致性,以及完整多模态推进过程的连贯性和正确性等方面接受联合筛选。
4.4 强化学习训练数据
美学、OCR 和信息图样本。对于美学样本,我们结合 HPSv3++、Pick-a-Pic、使用 Cosmos3PE 扩展的双语提示,以及内部生成的提示,构建约 28 万条提示,覆盖多种主体、风格、构图和空间配置。每条提示生成多张图像,并使用 HPSv3++ 评分;我们移除奖励差异较小的提示组,以保留能够提供更有区分度的相对监督的样例。OCR 语料包含约 6 万条双语文字渲染提示,中英文覆盖保持均衡。其中包括从 Flow-GRPO 收集的约 2 万条短文本提示,并进一步通过改写与扩展,形成约 4 万条文字更密集、渲染要求更复杂的长提示;从提示中提取指定文字,作为在线 OCR 奖励计算的参考转写。对于信息图样本,第一个 GRPO 阶段复用 OCR 语料,后续 GRPO 阶段则按照任务特定奖励联合轮换 OCR 与美学提示。我们还引入了从 Linear-DPO 语料 中筛选得到的约 12 万组偏好对用于 DPO,并进一步平衡人像与非人像内容以及中英文提示,以改善整体视觉偏好对齐。
图像编辑样本。 编辑专家在约 12 万个样例上训练,其中局部编辑和全局编辑分别约占 80% 与 20%。局部编辑包括信息图和文档操作、场景级与对象级编辑、人物动作与姿态调整、人像修饰、文字替换、图像修复与增强,以及以边界框或掩码为条件的编辑;全局编辑则侧重连贯的图像级变换。数据包含中文、英文及混合语言指令,指令长度在预定义区间内保持均衡,训练分辨率覆盖 512 x 512 至 2048 x 2048。数据筛选分为三个阶段。首先,移除损坏、重复、低分辨率或视觉质量退化的样本,并保留多种常见宽高比。随后,核验每条指令指定的实体、文字、空间区域和视觉属性是否在源图像中有对应依据,以及目标图像是否忠实实现所要求的修改。最后,对源图像和编辑后图像的美学、技术质量,以及结构与纹理丰富度进行评估,通过保守的成对聚合方式暴露任一图像中的不足。之后,再按任务类别和分辨率层级对保留样本进行再平衡,形成多样且具有挑战性的分布。

表 3 多模态与语言理解基准的定量评测结果。
5 实验
5.1 通用理解能力评测
多模态理解。 如图所示,SenseNova U1.5 在多种多模态基准上均表现出较强性能,覆盖 STEM 推理、通用视觉问答(VQA)、OCR、幻觉和视觉推理。与 SenseNova U1 相比,U1.5 在大幅拓展图像生成与编辑能力的同时,在大多数基准上保持或提升了表现,表明更强的生成建模并未以视觉理解为代价。具体而言,U1.5 在 MMMU、MathVista、MMBench、MMStar、AI2D、OCRBench、HallusionBench、BabyVision 和 TiR 上取得具有竞争力的结果,并在许多任务上达到或超过 Qwen3-VL 等强模块化基线。值得注意的是,尽管采用不依赖外部编码器的架构,U1.5 在多项视觉理解评测中与近期的无编码器模型 Gemma4-12B 相比也表现有利,凸显了原生多模态统一对通用感知与推理的有效性。
语言理解。 除多模态能力外,SenseNova U1.5 在统一多模态训练后,仍保留了较强的语言理解与指令遵循能力。其在 MMLU-Pro 和 C-Eval 上的表现尤为突出,分别达到 86.67 和 90.41,同时在 MMLU-Redux 与 SuperGPQA 上保持竞争力。更重要的是,U1.5 相比 SenseNova U1 显著提升了指令遵循表现,在 IFEval 上达到 93.35,在 IFBench 上达到 69.00。这表明,U1.5 引入的视觉生成和编辑能力并未显著削弱其底层语言能力。相反,模型在保留扎实文本推理基础的同时,在同一统一模型内支持了范围明显更广的多模态能力空间。

表 4 Qwen-Image-Bench-EN的定量评测结果。

表 5 Qwen-Image-Bench- ZH的定量评测结果。
5.2 图像生成
通用生成。我们在 Qwen-Image-Bench、GenEval、GenEval2、DPG-Bench 和 OneIG-Bench 上评估通用文生图能力,覆盖视觉质量、提示对齐、组合生成、密集指令遵循、文字渲染、风格和多样性。
Qwen-Image-Bench。如表 4 和表 5 所示,SenseNova U1.5 在 Open-Image-Bench 的英文与中文子集上均取得较强的整体表现。使用提示增强后,分数分别达到 60.22 和 60.13,在所评测开源模型中取得最佳整体表现。即使不使用提示增强,SenseNova U1.5 也持续优于 SenseNova U1,并与更大的开源基线保持竞争力,展示出较强的双语生成质量,缩小了与领先闭源系统之间的差距。

表 6 GenEval 的定量评测结果。

表 7 GenEval2 的定量评测结果。
GenEval。如表 6 所示,SenseNova U1.5 在 GenEval 上取得开源模型中最佳的整体表现,达到 0.92,超过 SenseNova U1 及 Qwen-Image 等更大规模基线。在计数、位置和属性绑定方面,改进尤为明显,同时单对象和双对象生成表现持续保持较强水平。这些结果表明,U1.5 不仅保留了基础对象级生成质量,也提升了组合一致性,以及在单条提示中同时满足多个视觉约束的能力。
GenEval2。如表 7 所示,SenseNova U1.5 在复杂约束下进一步展现出更强的组合推理和指令遵循能力。使用提示增强后,它显著优于所有所评测的开源基线,同时进一步缩小与领先闭源系统的差距。属性、计数和动词相关生成方面的改进尤其突出,表明模型能更好地建模对象属性、数量及交互。值得注意的是,SenseNova U1.5 更能忠实地将结构化、关系密集的提示转换为连贯的视觉构图,尤其是在需要同时满足多个约束时。

表 8 OnelG-EN 的定量评测结果。

表 9 OnelG- ZH 的定量评测结果。
OneIG-Bench。如表 8 和表 9 所示,SenseNova U1.5 在英文与中文评测中展现出较为均衡的生成能力。需要指出的是,其最突出的优势在于双语文本中心生成。此外,尽管模型规模相对紧凑,仅为 8B,仍能在对齐、推理和风格分数上保持竞争力。这种均衡表现对于实际生成场景尤为重要,因为这些场景要求准确的文字排版、语义一致性与视觉质量同时得到满足,而非分别独立优化。
DPG-Bench。如表 10 所示,SenseNova U1.5 的总体分数达到 88.11,位居表现最好的开源模型之列。它在实体、属性、关系及其他细粒度维度上均取得持续较强的结果,反映出扎实的语义落地能力与组合保真度。相比 SenseNova U1,U1.5 在提升总体分数的同时,保持了不同提示组成部分之间的均衡表现,表明它能够更可靠地遵循复杂且结构化的指令进行生成。

表 10 DPG-Bench 的定量评测结果。

表 11 CVTG-2K 的定量评测结果。
文本中心生成。我们进一步使用 CVTG-2K 与 LongText-Bench,在要求更高的文本中心场景中考察文字渲染,重点关注多区域布局与长篇双语文字生成。
CVTG-2K。如表 11 所示,SenseNova U1.5 在所有所评测模型中取得最佳整体表现,平均分达到 0.948。值得注意的是,它在密集文字渲染方面展现出尤其显著的改进,即使在更具挑战性的四区域和五区域设置中,词准确率也保持在 0.95 以上。相比 SenseNova U1,U1.5 进一步提升了 NED 和高区域数条件下的词准确率,同时保持相近的 CLIPScore,表明随着渲染文字量增加,模型仍具备更强的文字保真度与鲁棒性。

表 12 LongText-Bench 的定量评测结果。

表 13 IGenBench 的定量评测结果。
LongText-Bench。如表 12 所示,SenseNova U1.5 在英文与中文赛道上均取得领先的开源表现,尤其在中文方面较 SenseNova U1 有明显提升。随着文字长度和布局复杂度增加,其准确性仍然稳健,表明模型在密集、结构化和双语文字渲染方面的稳定性有所改善。
复杂信息图生成。我们进一步使用 IGenBench 和 BizGenEval,评估 SenseNova U1.5 在复杂信息图与商业内容生成方面的表现。这些基准要求模型同时满足文字内容、布局组织、图表语义、视觉属性和领域知识等要求。
IGenBench。如表 13 所示,SenseNova U1.5 在不使用提示增强时,已经取得最强的开源表现,并在加入 PE 后进一步提升。这些改进表明,模型的信息图生成更加可靠,结构化视觉规划能力更强,但与最强专有系统之间仍存在差距。

表 14 BizGenEval 的定量评测结果。

表 15 WISE 的定量评测结果。
BizGenEval。如表 14 所示,SenseNova U1.5 在简单与困难划分上均显著优于 SenseNova U1,使用提示增强后进一步达到领先的开源表现。这些增益在知识密集型样例中尤为明显,同时在布局、属性和文字相关维度上也保持一致。
推理中心生成。 我们进一步使用 WISE 评估知识密集型和推理密集型生成能力,覆盖文化知识、时间、空间、生物、物理和化学。
WISE。如表 15 所示,SenseNova U1.5 在不使用思维链(chain-of-thought,CoT)推理时已具备竞争力;启用 CoT 后,性能显著改善,并取得领先的开源表现。文化知识、生物和化学等知识密集领域的收益尤其明显,凸显了显式推理在使视觉生成扎根于世界知识方面的价值。

表 16 ImgEdit 的定量评测结果。

表 17 GEdit-Bench 的定量评测结果。
5.3 图像编辑
通用编辑。我们在 ImgEdit、GEdit-Bench、WeEdit 和 OmniRef-Bench 上评估通用编辑能力,覆盖多种编辑类型、语义一致性、文本中心编辑和基于参考图的编辑。
ImgEdit。如表 16 所示,SenseNova U1.5 在广泛的编辑类型上取得领先的整体表现,相比 SenseNova U1 有显著提升。这些改进在各类别间具有一致性,表明模型在保持源图像内容与视觉质量的同时,具备更强的编辑执行能力。

表 18 WeEdit 基准的定量评测结果。

表 19 OmniRef-Bench 的定量评测结果。
GEdit-Bench。如表 17 所示,SenseNova U1.5 取得最强的整体表现。这些收益在语义一致性方面尤为明显,表明模型能够更可靠地识别预期编辑、修改正确的视觉内容,并保留原图的语义上下文。同时,U1.5 在感知质量方面保持竞争力,说明更好的指令执行并未以视觉真实感或局部连贯性为代价。这反映了编辑正确性、内容保持与整体图像质量之间更好的平衡。
WeEdit。如表 18 所示,SenseNova U1.5 显著优于其他开源模型,并与领先专有系统保持竞争力。其较强的指令遵循、文字清晰度与背景保持表现,展示了稳健的文本中心编辑能力:准确执行所要求的文字修改,同时使无关视觉内容保持完整。结果进一步表明,语义编辑与视觉重建之间的协同有所改善。不过,翻译相关和推理密集型编辑仍相对困难,说明需要更深层语言与上下文理解的任务还有进一步提升空间。
OmniRef-Bench。如表 19 所示,在客观指标和基于多模态大语言模型(MLLM)的两种评估协议下,SenseNova U1.5 都在 OmniRef-Bench 上取得领先的开源表现。风格一致性与背景保持方面的增益尤为显著,表明模型能够更有效地利用参考信息,同时尽量减少对目标图像的非预期修改。此外,较强的主体和姿态一致性表明,在多种编辑条件下,身份、外观及结构线索都能得到可靠保留。这些结果说明,U1.5 不仅提高了参考保真度,也在参考利用、变换准确性与原始场景保持之间实现了更好的平衡,这对于稳健的多参考图编辑和定制化编辑至关重要。

表 20 RISEBench 的定量评测结果。

表 21 OpenING 的定量评测结果。
推理中心编辑。除直接遵循指令外,我们进一步使用 RISEBench,评估模型在修改图像之前必须推断时间、因果、空间或逻辑后果的编辑任务。
RISEBench。如表 20 所示,即使不使用 CoT,SenseNova U1.5 已优于所评测的开源基线,而显式推理又带来了进一步的显著提升。增益在因果、逻辑和时间编辑中最为明显,说明当所需变换必须先通过推断确定,而不能直接定位时,CoT 尤其有效。相比之下,空间编辑的收益并不那么稳定,这表明显式推理对隐含的多步变换更有价值,而非对能够直接获得视觉依据的编辑同样有益。

表 22 VBVR-Pro-Bench的定量评测结果。

表 23 Uni-MMMU-GaU 与 RealUnify-GEU 的定量评测结果。
5.4 交错生成
交错生成。 我们在 OpenING 和 VBVR-Pro-Bench 上评估这一能力。这些基准整合理解、推理与生成,用于开放式交错生成,以及以生成为中介的视觉推理。
OpenING。如表 21 所示,使用 CoT 的 SenseNova U1.5 在 OpenING 上取得领先的整体表现,优于 SenseNova U1,也超过了所比较的专有系统流水线。在图文连贯性、人类对齐和多步一致性上的较强结果,展示了可靠的开放式交错生成能力。
VBVR-Pro-Bench。如表 22 所示,SenseNova U1.5 在不同认知能力上取得新的最先进结果,展示了通过交错文本—图像生成直接开展推理的能力。它还对域外任务表现出较强泛化能力,优于 Nano-Banana-Pro 和 GPT-Image-2 等领先专有模型。
统一推理。 Uni-MMMU 评估生成辅助理解(generation-aided understanding,GaU),而 RealUnify 从重建、追踪、聚焦与导航等方面评估生成增强理解(generation-enhanced understanding,GEU)。
Uni-MMMU-GaU 与 RealUnify-GEU。 如表 23 所示,SenseNova U1.5 在 RealUnify-GEU 上取得领先表现,相比 SenseNova-U1-SFT 有较大提升;同时,在 Uni-MMMU-GaU 上与上一代 SenseNova 模型保持竞争力。这些发现表明,在 SenseNova U1.5 中,生成不仅是一种输出模态,也可以充当支持多模态推理与理解的中间表示。
6 结论
我们提出 SenseNova U1.5,进一步迈向这样的原生多模态系统:视觉理解与生成在共同的计算基础内学习,而不是通过彼此分离的感知与生成流水线连接起来。广泛的实验结果表明,这一方向能够扩展到基础图像合成之外:紧凑的原生表示能够在维持较强理解能力的同时,有效支持高保真生成、编辑、交错生成,以及推理密集型视觉任务。
从更广泛的角度看,SenseNova U1.5 表明,多模态统一的核心价值不在于架构简化,而在于能力交互。推理能够改善视觉内容的创建与变换方式,而生成本身也可以成为模型求解视觉问题时内部过程的一部分。这模糊了感知与创作之间的传统边界,并指向一类新的基础模型:在这些模型中,“看”、“推理”和“生成”不再作为松散耦合的功能进行训练,而是涌现为共享视觉智能的不同表现形式。我们认为,这是迈向一类多模态模型的重要一步:它们不仅仅组合不同模态,而是发展出用于解释、想象并作用于视觉世界的统一机制。