COMPASS는 장면 구성(composition) 의도를 인식하고 이를 제어 가능한 생성으로 연결하는 최초의 통합 멀티모달 프레임워크다. 현재 통합 모델이 세밀한 구성 인식에 취약하고 그 의도를 생성으로 옮기지 못하는 한계를 겨냥해, 공유 전문가 토큰 τ_c를 중심 의도 앵커로 삼는다. 인식 측면에서는 MoE 백본에 최소 침습 방식으로 구성 전문성을 주입하고 추론된 의도를 τ_c로 증류하며, 생성 측면에서는 이 τ_c를 전역 조건 신호로 재사용해 디노이징 궤적을 조종함으로써 수동적 구성 분석을 명시적 레이아웃 제어로 전환한다. 대규모 학습·평가를 위해 11클래스 분류체계와 추론 증강 어노테이션을 갖춘 Comp-11 데이터셋을 구축했다. 실험에서 범주 수준 구성 이해가 크게 향상되고 강한 베이스라인보다 구성 일관성·프롬프트 충실성이 높은 생성을 보였다.
- •구성 인식과 구성 기반 생성을 단일 시스템에 통합한 최초 프레임워크 COMPASS
- •공유 전문가 토큰 τ_c를 의도 앵커로 사용, 인식과 생성을 연결
- •MoE 백본에 최소 침습 구성 전문성 주입, τ_c로 디노이징 궁적 조종
- •11클래스 분류체계의 Comp-11 데이터셋 구축, 구성 일관·프롬프트 충실 생성 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models
- 1.COMPASS, 구도 인식과 구도 기반 생성을 단일 시스템에 통합한 최초의 멀티모달 프레임워크 제안
- 2.공유 전문가 토큰 τc를 의도 앵커로 삼아 MoE 백본에 구도 전문성을 최소 침습적으로 주입
- 3.동일 τc를 전역 조건 신호로 재사용해 디노이징 궤적을 조종, 수동 분석을 명시적 레이아웃 제어로 전환
- 4.11개 분류 체계와 추론 증강 주석을 갖춘 대규모 데이터셋 Comp-11 구축해 평가
왜 중요한가?
기존 통합 멀티모달 모델이 세밀한 구도 인식과 구도 의도의 제어 가능한 생성에 취약했던 문제를, 인식·생성을 잇는 단일 토큰 앵커로 해결해 프롬프트 충실도와 구도 일관성을 동시에 높였다는 점에서 이미지 생성 제어 기술의 실질적 진전이다.
본문 미리보기
arXiv:2606.28696v1 Announce Type: new Abstract: Composition is a high-level visual intent that governs where subjects are placed and how a scene is organized, yet current unified multimodal models remain unreliable at fine-grained composition recognition and struggle to turn such intent into controllable generation. We present COMPASS, the first unified multimodal framework that grounds composition-intent control in a single system spanning both composition perception and composition-guided gen
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

