- 보도자료
센스타임, ‘SenseNova U1.5 Lite Preview’ 오픈소스 공개
지난 4월 센스타임은 NEO-Unify 아키텍처를 기반으로 한 네이티브 통합 멀티모달 모델 SenseNova U1을 공개해 단일 모델에서 언어와 이미지의 의미, 픽셀 생성 기능을 통합해 이미지 이해와 추론, 생성을 하나의 모델로 수행할 수 있도록 구현했다.
이후 센스타임은 이미지 생성 및 편집 기능을 지속적으로 강화해 왔으며 최근 경량 통합 멀티모달 모델의 프리뷰 버전인 SenseNova U1.5-Lite-Preview를 오픈소스로 공개했다. SenseNova U1.5-Lite-Preview는 단순히 모델 규모를 확대한 것이 아니라 SenseNova U1을 전반적으로 고도화한 모델이다. 하나의 아키텍처에서 이미지 이해와 추론, 생성, 편집 기능을 유기적으로 연결했다.
또한 80억 개 매개변수 기반의 경량 MoT 구조만으로 네이티브 4K 이미지 생성과 더욱 정교하고 사실적인 질감 표현, 복잡한 이미지 제어 및 연속적인 반복 편집을 지원한다.

SenseNova U1.5-Lite-Preview 생성 예시
SenseNova U1.5-Lite-Preview는 기존 U1과 비교해 다음과 같은 기능이 크게 향상됐다.
1. 네이티브 4K 이미지 생성 지원
2. 더욱 정교한 부분 질감과 세부 요소, 사실적인 표현
3. 중국어·영어 텍스트의 정확한 구현과 복잡한 레이아웃 구성
4. 더욱 안정적인 이미지 편집 및 시각적 프롬프트 반영
SenseNova U1이 픽셀과 언어를 기반으로 네이티브 통합 멀티모달 모델을 엔드투엔드 방식으로 구축할 수 있다는 가능성을 입증했다면 U1.5는 이러한 통합 아키텍처의 확장 가능성을 검증하는데 초점을 맞췄다. 하나의 아키텍처가 이미지 이해와 생성 기능을 동시에 수행하는 데 그치지 않고 고해상도 이미지와 복잡한 정보 표현 더욱 사실적인 시각적 결과물까지 지원할 수 있음을 보여준다.
센스타임은 미래의 멀티모달 모델이 서로 다른 데이터 유형을 단순히 연결하는 시스템을 넘어 설계 단계부터 언어와 시각 정보, 행동을 함께 학습하고 추론하며 새로운 결과물을 만들어내는 통합형 AI 에이전트로 발전할 것으로 전망했다.
장문 프롬프트 처리 강화…복잡한 이미지도 정밀하게 구현
SenseNova U1.5-Lite-Preview는 이미지 생성 기능을 전반적으로 고도화했다. 단순히 4K 고해상도를 지원하는 데 그치지 않고 길고 복잡한 자연어와 구조화된 시각적 프롬프트를 이해해 사용자의 요구를 얼마나 정확하게 구현할 수 있는지에 초점을 맞췄다. 대형 이미지에서도 세부 요소를 확대했을 때 정교함과 사실적인 질감을 유지하고 정보가 많이 포함된 콘텐츠에서도 텍스트와 레이아웃을 안정적으로 구현하도록 성능을 개선했다.
디테일한 프롬프트로 이미지 제어 정확도 향상
포스터와 인포그래픽, 브랜드 이미지처럼 복잡한 콘텐츠를 제작하려면 하나의 이미지에 여러 조건을 동시에 반영해야 한다. 이미지에 포함할 인물과 사물, 각 요소의 상호작용과 위치, 전체적인 스타일, 표시할 문구는 물론 반드시 유지하거나 제외해야 할 내용까지 구체적으로 설정해야 한다.
SenseNova U1.5-Lite-Preview는 장문의 자연어와 구조화된 제작 지시사항을 이해하는 능력을 중점적으로 개선했다. 간단한 이미지는 일상적인 표현으로 몇 문장만 입력해도 빠르게 생성할 수 있다. 복잡한 작업은 전체 요구사항을 상세하게 입력하면 모델이 지정된 시각 구조에 따라 결과물을 구현한다.
센스타임은 긴 프롬프트가 좋은 이미지를 만들기 위한 필수 조건은 아니지만 복잡한 콘텐츠를 제작할 때 사용자가 결과물을 더욱 정밀하게 제어할 수 있도록 지원한다고 설명했다.
아래의 ‘백팩 제품 분석’ 인포그래픽에는 1,675단어로 구성된 장문 프롬프트가 사용됐다. 해당 프롬프트에는 복고풍 자연사 표본 도감 스타일과 5개 장으로 구성된 정보 구조, 중국어·영어 병기, 라틴어 표기 등 다양한 조건이 포함됐다.

SenseNova U1.5-Lite-Preview의 높은 프롬프트 반영 능력은 구조화된 템플릿을 단순히 학습하거나 특정 형식에 맞춘 결과가 아니라는 점도 특징이다. 별도의 프롬프트 확장(Prompt Enhance) 형식으로 구성된 학습 데이터에 크게 의존하지 않고도 길고 복잡하며 여러 조건과 단계가 포함된 시각적 지시사항을 안정적으로 수행한다.
센스타임은 이를 네이티브 통합 멀티모달 아키텍처의 장점으로 설명했다. 모델이 특정 프롬프트 형식을 기억하는 것이 아니라 자연어로 표현된 요구사항을 이미지의 구조와 구성 요소에 직접 연결하는 능력을 학습했다는 것이다.
복잡한 이미지 제작 지시사항을 보다 쉽게 작성할 수 있도록 실험적인 ‘Prompt Enhance Skill’도 함께 제공한다. 이 기능은 사용자가 간단하게 입력한 아이디어를 피사체와 레이아웃, 스타일, 텍스트, 세부 조건 등이 포함된 구체적인 제작안으로 자동 정리한 뒤 모델에 전달한다. 이를 통해 사용자가 원하는 결과를 보다 구체적으로 표현할 수 있으며 프롬프트에서 일부 요구사항이 누락돼 결과물이 의도와 다르게 생성되는 문제도 줄일 수 있다.
네이티브 4K 이미지 생성…확대해도 선명한 디테일 유지
4K는 단순히 픽셀 수를 늘리는 것을 넘어 세부 묘사와 질감, 빛과 그림자, 이미지 전체의 일관성까지 높은 수준으로 구현해야 하는 작업이다. SenseNova U1.5-Lite-Preview는 자연 풍경과 상업용 사진, 제품 포스터, 초광폭 파노라마, 세밀한 표현이 필요한 이미지에서도 사실적인 질감과 입체적인 빛의 변화를 구현한다.
아래 사례에서는 모델을 활용해 2018년부터 2026년까지 세계인공지능대회(WAIC)의 발전 과정을 담은 초광폭 파노라마 이미지를 제작했다.

모델이 생성한 2018년부터 2026년까지의 WAIC 발전 과정 (해상도 4K, 화면비 10:3, 프롬프트 총 길이 3,880자)
이 파노라마 이미지는 중국 전통 산수화의 다시점 원근법과 연속 서사 방식을 적용했다. 상하이 도시 전경과 스마트 교통, 클라우드 컴퓨팅, 스마트 팩토리, 거대언어모델, 생성형 AI, 피지컬 AI 로봇, AI 에이전트, 미래 도시를 하나의 산수화에 담았다. 이미지를 확대해도 다수의 문구와 아이콘을 비롯한 세부 디자인 요소가 선명하고 안정적으로 유지된다.
SenseNova U1.5-Lite-Preview는 초대형 이미지뿐 아니라 일반적인 크기의 이미지에서도 사실적인 표현과 세부 묘사 능력을 크게 향상했다.

해안 관광안내센터 건축 콘셉트 이미지

로맨틱 라이프스타일 테마의 콜라주 포스터

햇살 아래 인물 얼굴 클로즈업

레트로 다이어리 페이지

인물 사진과 과장된 타이포그래피를 결합한 테마형 포스터

배 위에 앉아 어망을 정리하는 어부

블루베리 크림을 장식하는 미니어처 셰프들

여름 콜드브루 커피 패션 광고 포스터

도로변에 서 있는 여성과 뒤로 빠르게 지나가는 차량들
텍스트 생성 및 레이아웃 성능 향상…정보가 많아도 안정적으로 구현
SenseNova U1.5-Lite-Preview는 중국어·영어 텍스트 생성과 복잡한 레이아웃 구성 능력을 강화했다. 잡지 내지와 여행 가이드, 복잡한 인포그래픽 등 정보가 많이 포함된 이미지에서도 전체적인 디자인 스타일을 유지하면서 내용을 더욱 명확하게 배치하고 텍스트를 정확하게 구현한다.

잡지 내지

인포그래픽

우캉루 시티워크 가이드
이미지 편집 기능 고도화…전체를 다시 생성하지 않고 필요한 부분만 수정
이미지 편집은 특정 영역의 픽셀을 단순히 다시 그리는 작업이 아니다. 모델이 이미지의 내용을 파악하고 사용자의 의도를 이해해 수정할 부분과 수정 방법, 반드시 유지해야 할 영역을 정확하게 구분해야 한다.
SenseNova U1.5-Lite-Preview는 네이티브 통합 멀티모달 아키텍처를 기반으로 여러 개의 독립된 모델을 연결하지 않고 하나의 모델에서 이미지 이해와 대상 영역 식별, 조건 추론, 픽셀 생성을 모두 수행한다.
또한 별도의 인코더를 사용하지 않는 인코더 프리(Encoder-free) 이미지 모델링 방식을 적용했다. 고정형 이미지 인코더에서 발생할 수 있는 정보 압축과 표현력의 한계를 줄이고 글자의 획과 부분 질감, 공간 구조 등 세밀한 정보를 더욱 온전하게 유지한다. 이를 통해 편집 정확도와 이미지의 일관성, 제어 성능을 높였다.
SenseNova U1.5-Lite-Preview에서 이미지 편집은 별도로 추가된 기능이 아니다. 하나의 통합 모델이 이미지의 현재 상태를 이해하고 사용자가 설정한 조건에 따라 원하는 장면을 다시 구성하는 기본 기능으로 구현됐다.
이에 따라 이미지 제작 방식도 한 번 생성한 뒤 결과가 마음에 들지 않으면 처음부터 다시 만드는 방식에서 벗어나 기존 결과물을 바탕으로 지속적으로 수정하는 방식으로 전환된다. 사용자는 문구를 변경하거나 레이아웃을 조정하고 필요한 요소를 추가하면서 만족스러운 결과가 나올 때까지 반복해서 편집할 수 있다.
현재 SenseNova U1.5-Lite-Preview는 다양한 주요 이미지 제작 워크플로를 지원한다.
참조 이미지 기반 스타일 재구성…다양한 주제에 동일한 디자인 적용
SenseNova U1.5-Lite-Preview는 참조 이미지의 색상과 구도, 질감, 글꼴, 전반적인 디자인 특징을 이해해 새로운 주제의 이미지에 적용할 수 있다. 또한 기존 정보를 그대로 유지하면서 포스터와 인포그래픽의 전체적인 디자인을 개선하고 시각적 완성도를 높일 수 있다.

입력 이미지

출력 이미지
사례: 청화백자 스타일의 전통 건축 지붕 도감
여러 참조 이미지를 결합한 편집…핵심 요소를 추출해 새로운 이미지로 재구성
여러 참조 이미지에서 인물과 제품, 배경, 스타일 등의 핵심 요소를 각각 추출해 하나의 이미지로 결합하고 새로운 장면으로 재구성할 수 있다. 아래는 중국식 매운 생선요리 ‘수이주위(水煮鱼)’ 메뉴와 프라이드치킨 이미지를 결합해 새로운 메뉴 이미지를 제작한 사례다.
입력 이미지:


출력 이미지:

단일 참조 이미지 기반 제작…한 장의 이미지로 완성형 디자인 구현
인물과 제품, 배경 이미지 한 장만으로도 새로운 디자인 콘텐츠를 제작할 수 있다. 원본 피사체의 고유한 특징과 외형, 주요 세부 요소를 유지하면서 포스터와 인포그래픽, 마케팅 페이지 등 다양한 결과물을 생성한다.

입력 이미지

출력 이미지
사례: 인물 사진을 활용한 이력서 디자인
인포그래픽 부분 편집…전체 구성은 유지하고 필요한 요소만 수정
인포그래픽의 제목과 수치, 아이콘, 레이블, 차트, 콘텐츠 영역 등을 선택해 수정할 수 있다. 특정 요소의 추가·삭제와 위치 조정, 부분적인 디자인 개선, 오류 및 결함 보정 등을 지원한다.

입력 이미지

출력 이미지
사례: 제목 문구 교체
이미지 속 텍스트 편집…기존 디자인 유지
실제 장면에 포함된 텍스트를 수정하면서 기존 글꼴과 질감, 원근감, 레이아웃, 요소 간 겹침 관계를 그대로 유지한다. 변경된 문구가 원본 이미지에 자연스럽게 어우러지도록 구현한다.

입력 이미지

출력 이미지
영역 지정 기반 정밀 편집…수정할 부분만 정확하게 선택
사용자는 영역을 직접 표시하거나 좌표와 마커(Marker)를 지정해 수정할 위치와 범위를 모델에 정확하게 전달할 수 있다. 이를 통해 선택한 영역의 색상과 형태 등 세부 속성만 정밀하게 조정할 수 있다.

입력 이미지

출력 이미지
사례: 빨간색 지정 영역 수정
U1 기반의 전면적인 고도화…아키텍처 검증에서 실제 활용 단계로
SenseNova U1은 네이티브 통합 멀티모달 아키텍처의 기술적 가능성을 입증했다. 센스타임은 이후 실제 서비스 적용과 오픈소스 커뮤니티의 피드백을 통해 이미지 생성 및 편집 과정에서 개선이 필요한 부분을 확인했다.
1. 이미지 생성 과정에서 서로 다른 영역이 자연스럽게 연결되지 않아 미세한 격자무늬나 이어 붙인 흔적, 질감의 단절이 나타나는 경우가 있었다. 해상도가 높아질수록 세부 요소와 복잡한 공간 관계, 이미지 전체의 일관성을 구현하는 난도도 높아졌다.
2. 이미지 편집에서는 자연어로 입력한 지시사항을 이해할 수 있었지만 복잡한 작업에서 편집 대상이 아닌 영역까지 바뀌거나 인물의 고유한 특징과 피사체 구조가 달라지는 문제가 발생하기도 했다. 특정 부분의 수정이 이미지 전체에 영향을 미치는 경우도 있었다.
SenseNova U1.5-Lite-Preview는 모델 규모를 무조건 확대하지 않고 실제 콘텐츠 제작 과정에서 발생하는 문제를 해결하기 위해 이미지 생성과 편집의 전체 과정을 체계적으로 개선했다.
1. 격자 형태의 왜곡과 고해상도 이미지의 세부 묘사 문제를 개선하기 위해 이미지 생성 헤드(Generation Head)를 새롭게 설계했다. 시각 토큰의 격자 구조가 최종 이미지에 미치는 영향을 줄이고 학습 해상도를 4K까지 확대했다.
2. 이미지 편집 성능을 높이기 위해 편집 데이터와 학습 과제를 전면 재구성했다. 원본 이미지의 내용과 피사체 고유의 특징, 공간 구조, 편집 대상이 아닌 영역을 유지하는 능력을 강화했다. 이를 통해 지정한 부분을 수정하면서 변경할 필요가 없는 영역은 최대한 원본 그대로 보존한다.
이러한 개선을 바탕으로 SenseNova U1.5-Lite-Preview는 주요 이미지 생성·편집 품질 평가에서 U1보다 높은 점수를 기록했다. 80억 개 매개변수 기반의 경량 MoT 구조만으로 상용 비공개 모델에 견줄 만한 이미지 생성 및 편집 성능을 구현했다.
Qwen-Image-Bench: 47.14 → 55.20(Prompt Enhance 적용)
ImgEdit-Bench: 3.90 → 4.37
GEdit-Bench-en: 7.47 → 8.17
GEdit-Bench-zh: 7.42 → 8.05


SenseNova U1.5-Lite-Preview는 현재 전 세계에 오픈소스로 공개됐다. 개발자와 콘텐츠 제작자는 모델을 내려받아 직접 사용해 보고 의견과 개선 사항을 제안할 수 있다.
GitHub: SenseNova U1.5 Preview
Hugging Face: SenseNova U1.5-8B-MoT-Preview
ModelScope: SenseNova U1.5-8B-MoT-Preview
U1부터 U1.5까지 이어진 오픈소스 공개는 센스타임이 AI 기반 기술을 지속적으로 고도화해 온 성과를 보여준다.
전문 사용자를 위한 고품질 콘텐츠 제작 모델 U1 Pro도 현재 제한된 사용자를 대상으로 테스트를 진행하고 있으며 조만간 일반 사용자에게 공개될 예정이다.

되돌아오다
스마트 비지니스
스마트 시티
스마트 라이프
스마트 오토