TILT는 복잡한 조합형 프롬프트를 충실히 반영하는 이미지를 만들기 위해 테스트 시점에 보상 정렬을 수행하는 학습 불필요 텍스트-이미지 생성 프레임워크다. 저자들은 조합 실패를 결합 분포와 단일 개념 분포 사이의 중첩 모드 문제로 해석하고, 모든 개념이 함께 등장하는 샘플에 높은 점수를 주는 보상을 정의했다. 이 보상은 기반 모델 자체에서 유도되므로 외부 감독이나 별도 보상 모델이 필요 없으며, KL 제약 목적함수에서 닫힌 형태의 기울어진(tilted) 목표 분포와 확산 샘플링용 가이던스 절차가 도출된다. 여기서 나온 두 가지 가이던스 전략을 절충한 하이브리드가 가장 좋았고, T2ICompBench 프롬프트 실험에서 이미지 품질을 유지하면서 조합 정렬을 개선했다.
- •조합 생성 실패를 결합 분포와 단일 개념 분포의 중첩 모드로 해석한 점이 방법론의 출발점이다.
- •모든 개념이 동시에 나타난 샘플을 선호하는 보상을 기반 모델 내재적으로 정의해 외부 보상 모델이 필요 없다.
- •KL 제약 목적함수에서 닫힌 형태의 tilted 목표 분포와 확산 샘플링 가이던스 단계가 유도된다.
- •두 가지 가이던스 전략을 절중한 하이브리드 방식이 가장 강한 성능을 보였다.
- •T2ICompBench 프롬프트 실험에서 이미지 품질 손실 없이 조합 정렬성을 개선했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward
본문 미리보기
arXiv:2607.21606v1 Announce Type: new Abstract: Recent advances in powerful text-to-image generation models have made it increasingly important to develop test-time methods that modify the sampling trajectory to produce images more faithful to complex compositional prompts. We present TILT, a training-free framework for compositional text-to-image generation via test-time reward alignment. We interpret compositional failures as overlap modes between joint and single-concept distributions, and d
전체 내용이 궁금하다면?
원문을 직접 읽어보세요