Photoroom이 7B 텍스트-이미지 모델 PRX의 사전학습 데이터 파이프라인을 공개했다. 공개·내부 데이터셋을 혼합해 수억 장 규모 코퍼스를 구성하고, Qwen3-VL-8B로 전체 이미지를 100~200단어 장문 캡션으로 재작성해 짧은 캡션 대비 FID를 약 21에서 13 수준으로 개선했다. 데이터 구축은 Lance, 학습 스트리밍은 Mosaic MDS를 쓰는 이원 구조를 채택했고, JPEG 품질 92 저장이 PNG 대비 출력 품질에 유의미한 차이가 없음을 실험으로 검증했다. 필터링·중복 제거는 삭제 대신 스킵 리스트로 처리해 옵트아웃 대응과 어블레이션이 쉬워졌다. 대규모 생성 모델 학습에서 데이터 파이프라인 설계의 실전 노하우를 구체적 수치와 함께 담은 드문 사례다.
- •장문 VLM 재캡셔닝이 최대 레버: Qwen2.5-VL-7B 장문 캡션이 짧은 LLaVA 캡션 대비 FID·CMMD·DINO-MMD 전 구간 우위 (FID 약 21→13)
- •캡셔너 비교 결과 Qwen3.5-9B가 품질 최고였으나 속도(6.5 img/s)와 안정성 문제로 20 img/s의 Qwen3-VL-8B 채택
- •Lance(구축·탐색)와 Mosaic MDS(학습 스트리밍) 이원 포맷 전략, 프래그먼트 수를 낮게 유지하는 것이 쿼리 성능의 핵심
- •JPEG 품질 92 저장과 PNG 학습 모델의 생성 결과가 사실상 구분 불가함을 실험으로 검증, 저장 용량 3~10배 절감
- •삭제 대신 스킵 리스트로 필터링·중복 제거 처리, 사용자 옵트아웃과 필터 어블레이션에 유연하게 대응
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PRX Part 4: Our Data Strategy

- 1.Photoroom이 7B 텍스트-이미지 모델 PRX의 데이터 파이프라인 전략을 상세 공개
- 2.전략 핵심: 사전학습은 폭·다양성, 미학 필터링은 파인튜닝으로 분리, 전량 VLM 재캡션
- 3.Qwen3-VL-8B 캡셔너 채택(H200당 20장/초), 긴 캡션이 FID·CMMD 전 지표 개선 입증
- 4.Lance로 큐레이션, MDS로 스트리밍, JPEG q92 저장이 PNG와 품질 차이 없음을 실측
왜 중요한가?
이미지 생성 모델 훈련의 비공개 영역이던 데이터 파이프라인을 벤치마크 수치·실패 사례(Lance 파편화 등)까지 공개한 드문 실전 문서다. 'JPEG q92면 충분', '긴 캡션이 최대 레버' 같은 실측 결론은 자체 확산 모델을 훈련하는 팀이 바로 참고할 수 있다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 01:53AI 초안

