TILT는 복잡한 조합형 프롬프트를 충실히 반영하는 이미지를 만들기 위해 테스트 시점에 보상 정렬을 수행하는 학습 불필요 텍스트-이미지 생성 프레임워크다. 저자들은 조합 실패를 결합 분포와 단일 개념 분포 사이의 중첩 모드 문제로 해석하고, 모든 개념이 함께 등장하는 샘플에 높은 점수를 주는 보상을 정의했다. 이 보상은 기반 모델 자체에서 유도되므로 외부 감독이나 별도 보상 모델이 필요 없으며, KL 제약 목적함수에서 닫힌 형태의 기울어진(tilted) 목표 분포와 확산 샘플링용 가이던스 절차가 도출된다. 여기서 나온 두 가지 가이던스 전략을 절충한 하이브리드가 가장 좋았고, T2ICompBench 프롬프트 실험에서 이미지 품질을 유지하면서 조합 정렬을 개선했다.
- •조합 생성 실패를 결합 분포와 단일 개념 분포의 중첩 모드로 해석한 점이 방법론의 출발점이다.
- •모든 개념이 동시에 나타난 샘플을 선호하는 보상을 기반 모델 내재적으로 정의해 외부 보상 모델이 필요 없다.
- •KL 제약 목적함수에서 닫힌 형태의 tilted 목표 분포와 확산 샘플링 가이던스 단계가 유도된다.
- •두 가지 가이던스 전략을 절중한 하이브리드 방식이 가장 강한 성능을 보였다.
- •T2ICompBench 프롬프트 실험에서 이미지 품질 손실 없이 조합 정렬성을 개선했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward
- 1.TILT: 학습 없이 테스트타임 리워드 정렬로 구성적 텍스트-이미지 생성을 개선하는 프레임워크
- 2.구성 실패를 결합-단일 개념 분포의 중첩 모드로 해석, 모든 개념이 공존하는 샘플을 선호하는 보상 정의
- 3.보상이 베이스 모델에 내재되어 외부 보상모델·감독 불필요, KL 제약 하 닫힌형 목표 도출
- 4.T2ICompBench에서 이미지 품질 유지하며 기존 베이스라인 대비 구성 정렬 개선
왜 중요한가?
'빨간 컵 위의 파란 공' 같은 복합 프롬프트에서 개념 누락이 생기는 디퓨전 모델의 고질적 문제를 외부 보상모델 없이 샘플링 단계에서 교정한다. 재학습 비용 없이 기존 생성 모델에 바로 적용 가능한 테스트타임 기법이라는 점이 실용적이다.
언급 프로젝트
본문 미리보기
arXiv:2607.21606v1 Announce Type: new Abstract: Recent advances in powerful text-to-image generation models have made it increasingly important to develop test-time methods that modify the sampling trajectory to produce images more faithful to complex compositional prompts. We present TILT, a training-free framework for compositional text-to-image generation via test-time reward alignment. We interpret compositional failures as overlap modes between joint and single-concept distributions, and d
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:02AI 초안

