SenseNova U1.5 Lite正式版發佈:支援超長指令,解鎖原生4K真實視覺創作流程

8分鐘

今天,商湯科技正式開源輕量級、原生統一多模態大模型 SenseNova U1.5 Lite。與預覽版(U1.5 Lite Preview)呈現的原生統一多模態模型能力相比,正式版更關注的是,這些能力能否更準確、更穩定地進入真實視覺創作流程。

模型重點圍繞真實視覺任務重新完善訓練數據、任務設計與後訓練流程,強化視覺質量、複雜指令遵循、文字與佈局、原生4K、圖像編輯和精細視覺控制等,提供更高可控性、更高清、更高性價比的能力工具,推動 AI 視覺生成真正跨越到「穩定完成真實視覺交付」的新階段。

目前模型已面向全球開源,開發者與創作者可直接部署體驗。

 

GitHub:https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15

魔搭社區https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT

SenseNova Studio線上體驗https://unify.light-ai.top/

 

更完整的視覺創作能力,告別 AI 創作瓶頸

「精心寫了 25 分鐘的詳細 Prompt,模型卻只能解析 1k 字符,不得不花半小時刪減細節」;「只想改掉圖中的一隻杯子,AI 卻把背景和主角的臉一起換了」。

這些幾乎是每個創作者都遇到過的「崩潰瞬間」。過往幾年,行業往往把重點放在追求「畫面美感」和「寫實感」上;但在實際生產流程中,真正的核心問題是:模型能否精準執行你的完整意圖?

SenseNova U1.5 Lite 解決了這一難題:

  • 3-4k 字符超長複雜指令遵循:打破大多數開源模型在指令超過 1k 字符時容易崩潰、遺漏細節的瓶頸。SenseNova U1.5 Lite 原生支援 3-4k 上下文長度,能夠同時處理主體、數量、空間關係、文字、佈局、風格等多重約束,提升複雜視覺任務的執行穩定性。

  • 更高質量的視覺生成:改善整體構圖、色彩、材質、光影、真實感和局部細節,減少「局部正確但整體完成度不足」的情況。

  • 更可靠的原生圖像編輯:增強主體身份、空間結構、版式關係和非編輯區域的保持,同時提升局部修改、元素替換、文字精修和多參考圖編輯能力。

  • 更好的文字與複雜佈局:加強中英文文字、海報、信息圖、品牌視覺及多文本排版能力,從「生成內容」進一步走向「組織完整視覺表達」。

  • 更精細的視覺控制:支援 Bounding Box、Visual Marker 以及單圖、多圖參考等方式,對指定區域和對象進行更準確的編輯。

  • 原生4K高解像度輸出:在高解像度生成中兼顧整體構圖與極精細的肌理、微小文字與光影折射。

 

實戰演練:真實場景深度還原

我們挑選了最能考驗「硬實力」的創作場景,帶你了解 SenseNova U1.5 Lite 如何完成真實交付。

場景一:複雜視覺表達

1、創意海報與封面生成:

展現出極佳的美學完成度與高對比度質感。具備高精度的複雜佈局能力,可精準掌控文字與留白節奏;在處理文字與物體的空間遮擋時,能夠維持光影的自然連貫,充分展現了原生多模態對三維空間疊加關係的深刻理解。

image (12).png
image (13).png
image (14).png
image (15).png
image (16).png
image (17).png

2、高密度信息圖生成:

保證中英文、數據等豐富細節的準確無誤;通過多層級結構化空間映射,完美串聯各類標籤和信息,實現了複雜信息可視化圖表的高質量一次性交付。

img_v3_0214p_f3760868-5caf-466f-bfdf-d0999c69ac5g.jpg
image (18).png
image (19).png

3、高清細節與藝術質感:

在建築結構、人像肌理、藝術畫作筆觸等複雜場景中,展現出媲美攝影與大師畫作的細膩質感。

image (21).png
image (22).png
image (23).png
image (24).png
image (25).png
image (26).png
image (27).png
image (28).png

場景二:原生圖像編輯

1、佈局與風格可控編輯

  • 草圖/線稿轉復古暖色漫畫:精準遵循超長複雜指令,保留線稿分鏡與人物輪廓,上色與材質補充自然細膩。

prompt:請把這張手繪草圖渲染成一幅復古暖色調的手繪漫畫風格插圖,背景帶有米黃色紙張質感,整體光影溫馨,突出燭光下的專注氛圍。構圖上保持草圖的版式,中心是主場景,周圍環繞五個帶編號的分鏡面板。左上角用巨大的毛筆字體寫上主標題「敲擊靈魂的機械軸」,下方加一個綠色標籤寫上「每一顆軸,都是我與世界對話的方式。」。中心畫面裏,戴着護目鏡的少年正在燭光下用螺絲批組裝鍵盤,桌上有印着「BUILD SOUL」的馬克杯和散落的軸體,少年上方的對話框寫「深夜的工作枱,只有我、燭光,還有這些小傢伙。」;旁邊黑貓的對話框寫「又在折騰鍵盤啊?喵~」。右上角的面板①展示綠色金屬鍵盤外殼,標題寫「① 選個可靠的『殼』!」;下面配文「訂製金屬外殼,沉甸甸的安全感!」。右側中間的面板②展示四種顏色的機械軸體,標題寫「② 挑選心儀的『軸』!」;配文「紅軸輕盈,茶軸均衡,青軸清脆……總有一款擊中靈魂!」。右下角的面板③特寫拔鍵器取下鍵帽的動作,標題寫「③ 拔鍵器,yyds!」;加上擬聲詞「咔嗒!」;配文「拔鍵、換軸、換鍵帽,自由才是機械鍵盤的浪漫!」。左側中間的面板④展示一堆反光的透明鍵帽,標題寫「④ 透明鍵帽,透出光芒!」;配文「燈光透過鍵帽的那一刻,整個世界都溫柔了。」。左下角的面板⑤展示發出溫暖背光的組裝完成鍵盤,標題寫「⑤ 大功告成!」;配文「每一次敲擊,都是靈魂的回響!」。底部中間的畫面是少年興奮敲擊鍵盤的動態特寫,加上綠色爆炸框文字「這就是屬於我的聲音!♡」,底部寫上擬聲詞「噠噠噠噠噠!!」。右下角角落畫一隻小貓看着蠟燭,氣泡裏寫「機械鍵盤的魅力,在於創造,更在於熱愛。喵~」。

image (29).png

線稿圖

image (30).png

編輯後

  • 跨主題遷移並保持版式:深入理解原海報的版式框架,切換主題後仍能保持完美的視覺結構。

prompt:沿用參考圖的復古印刷風格,生成一張天文台公眾開放日主題海報。

image (31).png

參考圖

image (32).png

編輯後

2、多參考圖融合生成

  • 融合核心元素與場景重組:如「橘貓騎電單車坐在咖啡館內」,提取多張圖片的核心特徵(主體、風格、光影),在全新空間中自然重組,光影與比例渾然天成。

image (33).png
image (34).png
image (35).png

參考圖

image (36).png

編輯後

  • 美食海報重組:多張美食圖片融合為一張完整海報,自動配合一致的背景、餐盤質感與環境光,並完美植入排版文案。

image (37).png
image (38).png
image (39).png
image (40).png
image (41).png

參考圖

image (42).png

編輯後

  • 信息圖參考元素替換:保留原海報中的所有元素,同時替換圖中的樂隊成員,並將下方板塊重新排列,添加曲目和新的劃線元素。

prompt:使用圖片2和圖片3作為內容參考,而不是貼上的矩形圖片,編輯圖片1。將帶框的樂隊剪影替換為圖片2中的 Radiohead 五位成員,並轉換成海報的仿舊單色半色調風格。將下方四個特色區塊重新編排為緊湊的左側欄,並在右側添加一份 ESSENTIAL LISTENING 清單,僅使用圖片3作為文字內容和層級結構的參考。將新清單直接呈現在同一片連續的黑色仿舊背景上,配以相配的米白色文字;不要保留任何白色或奶油色卡片背景。保留所有原有文字及海報的其他所有元素。

image (43).png
image (44).png
image (45).png

參考圖

image (46).png

編輯後

3、信息圖編輯

  • 變換風格,主體保持不變:

prompt:將整張海報改為藍銀色高科技工業風,保持所有文字內容、機械人主體和信息布局不變。

image (59).png
image (60).png

 

  • 局部屬性修改:

prompt:將植物周圍 Cd、Pb、Zn、Cu、As 五個圓形標籤改為磚紅色,文字保持米白色。
image (49).png
image (50).png

 

4、文字編輯

  • 黑板餐牌局部文字替換:

prompt:將黑板餐牌上「Summer Drinks」標題下方第一行、位於白色三角形符號右側的黃色手寫體文字「快樂檸檬水」替換為紅色手寫體文字「士多啤梨啵啵奶茶」,保持原有粉筆質感和筆觸風格,嚴格保留黑板上其餘所有文字(包括價格5.00)、插圖(檸檬、咖啡杯、冰棒)、木框結構及背景綠植環境不變。

image (51).png
image (52).png

 

  • 多處精準文字重寫:
prompt:在畫面中央的超大磚紅色主標題中,將 「PEARL」 替換為 「HORIZON」。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。 
在左上方的英文地點標題中,將 「ORIENTAL PEARL TOWER」 替換為 「SHANGHAI LANDMARK」。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。
在左上方的英文地點副標題中,將 「SHANGHAI, CHINA」 替換為 「CITY OF HARMONY」。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。
在右上方的中文地點標題中,將「東方明珠」替換為「城市之光」。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。
在左側城市宣言第一句,將 「A SYMBOL OF SHANGHAI.」 替換為 「A BEACON OF VISION.」。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。
在右側城市宣言第一句,將 「DESIGNED FOR HARMONY.」 替換為 「BUILT FOR TOMORROW.」。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。
在建築底部中文大標語,將 「時代的瞭望 · 城市的明珠」 替換為 「城市的節奏 · 未來的地標」。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。
在底部英文宣言,將 「A LANDMARK OF VISION. A BEACON OF SHANGHAI.」 替換為 「A LANDMARK OF TOMORROW. A BEACON OF THE CITY.」。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。
image (53).png
image (54).png

 

5、指定區域與局部精細編輯

提示詞:將紅框中的「WHY IT MATTERS」模組完整翻譯為中文,保留原有圖標、層級和排版;紅框僅作定位,輸出中不要保留紅框。

image (55).png
image (56).png

 

提示詞:按照圖像上的標記及整體提示,對此場景進行創意轉化,營造富有情調、精緻高雅的午夜酒廊氛圍;完成後移除標註。

image (57).png
image (58).png

 

8B 參數架構突破:不只是「更多」能力,還是「更穩定」和「更高性價比」

作為8B參數的輕量化模型,SenseNova U1.5 Lite 在指令遵循與圖像編輯保持度上超越了同量級模型,並在文字渲染與複雜佈局上達到了媲美超大規模商業模型的交付水平。

benchmark_overview_all_zh_v24.png

面對不同視覺任務,業界通常採用顯式 Router(路由)或多專家協同機制,將渲染、美學、編輯分發給不同模型。但這大幅增加了系統開銷與推理延遲。

SenseNova U1.5 Lite 基於 NEO-unify 統一架構,打破了這一傳統定式:

  • 解耦訓練與交付(MOPD 蒸餾):訓練階段針對文字、美學、編輯獨立訓練專家模型(Expert);交付階段,通過多專家在線策略蒸餾技術(MOPD),將多專家能力無損融合至單體 8B 模型中。

  • 理解與生成雙向反饋:視覺語義理解與空間建模形成的認知直接反饋生成,使其自然消化多層級指令,同時在多模態理解榜單上保持強勁表現。

  • 極致性價比:8B 參數量支援單卡流暢運行,無須 Router 頻繁切換,單次 Pass 即可兼顧語義理解與像素生成,大幅降低調用成本與推理延遲。

img_v3_0214o_06bcb09f-0032-41f6-9b4b-abda5bf93b0g.jpg

在 OneIG(EN、ZH)、LongText(EN、ZH)、BizGenEval(Easy、Hard)、CVTG、IGenBench 與 Qwen-Image-Bench 上的生成延遲與平均性能對比。

此外,正式版強化了任務導向的強化學習(RL)後訓練,聚焦優化三大關鍵維度:

  • 指令遵循(Instruction Compliance):輕鬆解析超長 Prompt,精準執行嚴苛的多重複雜限制。

  • 視覺偏好(Visual Preference):全面優化構圖、材質與光影,提升畫面質感與視覺完成度。

  • 編輯保持(Editing Preservation):實現像素級局部修改,完美保留非目標區域的內容與結構。

這種複雜指令跟隨與精細編輯能力,使 SenseNova U1.5 Lite 可以無縫支援多輪迭代修改而不偏離方向。這真正打破了單次生成的局限,讓輕量級模型參與長流程的持續創作與二次改造成為可能。

 

讓開源創作從「能看」走向「能用」

多模態是 AI 邁向物理世界與真實生產力的必經之路。商湯 SenseNova U1.5 Lite 開源的初衷,正是希望為全球開發者與創作者提供一個輕量、統一、極具性價比且高度可控的生產力工具。

歡迎前往 GitHub / Hugging Face 部署體驗,與我們共同繁榮開源生態!

GitHub:https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15

魔搭社區:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT

SenseNova Studio 在線體驗:https://unify.light-ai.top/

SenseNova U1.5 Lite 正式版發布:支援超長指令,解鎖原生 4K 真實視覺創作流程