NEO-unify:原生架構打造端到端多模態理解與生成統一模型
当前多模態智能架構困境
長期以來,多模態研究已形成一種默認範式:視覺編碼器(Vision Encoder, VE) 负責感知與理解,而變分自編碼器(Variational Autoencoder, VAE) 则用於內容生成。近期的一些工作尝試構建共享編碼器,但這種折衷往往引入新的結構性設計權衡。
由此回到第一性原理:構建一體化模型直接處理原生输入,即像素本身與文字本身。商湯科技聯合南洋理工大學,提出一種全新的架構範式:NEO-unify(preview),一個原生、統一、端到端的多模態模型架構。它不僅越過了当前視覺表征的爭论,也摆脱了预训练先驗和規模定律瓶颈的限制。最關鍵的是:不需要 VE,也不需要 VAE。
我們正扩大規模、持續迭代。更多模型與開源成果,將很快與大家見面。
NEO-unify原生一體化架構新範式
NEO-unify 第一次迈向真正的端到端統一框架,能够直接從近乎無損的資訊输入中學習,并由模型自身塑造內部表征空間。首先,引入近似無損的視覺接口,用於統一圖像的输入與输出表示;其次,采用原生混合Transformer(Mixture-of-Transformer,MoT)架構,使理解與生成能够在同一體系中協同進行;最終,通過統一學習框架實現跨模態训练:文本采用自回归交叉熵目標,視覺通過像素流匹配進行優化。
模型效果
1、定量結果分析


2、生圖效果展示


技術發現
1、無編碼器設計能够同時保留抽象語義與细粒度表征
[圖像重建任務]
我們先前的工作 NEO(Diao et al., ICLR 2026)表明,原生端到端模型同樣能够學習到豐富的語義表征。在此基礎上,我們進一步觀察到一個有趣的現象:即使在冻結理解分支的情况下,獨立的生成分支仍然能够從表示中抽取并恢复细粒度的視覺细節。
基於這一發現,我們训练了 NEO-unify(2B)。在初步 9 萬步预训练後,模型在 MS COCO 2017 上取得 31.56 PSNR 和 0.85 SSIM,而 Flux VAE 的對應指標為 32.65 和 0.91。這一結果表明,即使不依赖预训练 VE 或 VAE,近似無損的原生输入仍能够同時支持高質量的語義理解與像素級细節保真。
域外圖像重建(2B NEO-unify,理解分支冻結)

[圖像編輯任務]
據此,我們進一步開展探索:NEO-unify 將所有全模態條件資訊統一输入到理解分支,而生成分支僅负責生成新的圖像。
即使在冻結理解分支的情况下,NEO-unify(2B) 仍展現出強大的圖像編輯能力,同時顯著减少了输入圖像令牌的數量。在使用開源生成與圖像編輯數據集并進行初步 6 萬步混合训练後,模型在 ImgEdit 基準上取得 3.32 的成績,且理解分支在整個训练過程中保持冻結。
小規模數據驗證(2B NEO-unify,理解分支冻結)

ImgEdit提示词編輯(2B NEO-unify,理解分支冻結)

2、無編碼器架構與 MoT 主干高度協同大幅降低內在冲突
借助预训练的理解分支與生成分支,NEO-unify 使用相同的中期训练(MT)與 监督微調(SFT) 數據進行聯合训练。即使在較低的數據比例和損失權重下,理解能力依然保持穩定,而生成能力则收敛很快。二者在 MoT 主干中協同提升,整體冲突極小。

3、無編碼器架構,展現更高數據训练效率
此外,我們首先進行 web-scale 预训练,隨後在多樣且高質量的數據語料上依次進行中期训练(MT) 和 监督微調(SFT)。與 Bagel 模型相比,NEO-unify 展現出更高的數據训练效率,在使用更少训练 token 的情况下取得了更優的性能。

未來展望
這不僅僅是一種模型架構探索,更是迈向下一代智能形態的一步:
• 感知與生成交织的閉環
• 全模態推理
• 視覺推理
• 空間智能
• 世界模型
• …
一條新的路線圖正在展開:模型不再在模態之間進行轉換,而是能够原生地跨模態思考。多模態 AI 不再只是連接不同系統,而是構建一個從未割裂的統一智能體,并讓所需能力從其內部自然涌現。