합성 데이터 재귀 학습은 데이터 부족을 완화하지만, 반복 학습이 분포의 꼬리를 침식하고 출력을 동질화하는 '모델 붕괴'를 일으킬 수 있다. 흔히 해법으로 여겨지는 데이터 선택은 검증기가 참조하는 분포에 크게 의존하는데, 연구진은 각 검증기가 목표 매니폴드의 작고 편향된 일부만 관찰하는 저자원 환경에서는 선택 자체가 편향됨을 보인다. 이런 상황은 원본 데이터를 통합할 수 없는 의료 컨소시엄이나 금융기관 같은 데이터 사일로에서 발생하며, 선택이 지역 매니폴드에 맞는 표본만 남기고 전역적으로 중요한 꼬리 모드를 제거해 붕괴를 막기는커녕 촉진한다. 저자들은 원본 공유 없이 여러 사일로에서 Wasserstein 프록시 참조를 구성해 다양성 저하를 완화하는 초기 해법을 제시한다.
- •저자원 검증 환경에서는 데이터 선택이 편향되어 모델 붕괴를 막기는커녕 촉진함을 이론적으로 증명
- •사일로화된 선택이 전역 ɱ관련 꼬리 모드를 제거해 멱격칙 다양성 감쇠를 유발
- •의료 컴소시엄·금융기관 같이 원본 데이터를 통합할 수 없는 사일로에서 자연히 발생
- •원본 공유 없이 여러 사일로에서 Wasserstein 프록시 참조를 구성해 다양성 저하 완화
- •재귀 합성데이터 파이프라인은 실데이터 커버리지가 파편적일 때 각별한 주의 필요
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Sample Selection Bias Precipitates Model Collapse
- 1.재귀적 합성데이터 학습의 모델 붕괴를 막는 데이터 선택이 저자원 환경선 오히려 붕괴 유발
- 2.각 검증자가 목표 분포의 작고 편향된 일부만 볼 때 선택 자체가 편향됨
- 3.지역 매니폴드에 맞는 샘플만 남기고 전역 꼬리 모드 제거해 붕괴 가속·멱법칙 다양성 감소 증명
- 4.원시데이터 공유 없이 다중 사일로서 Wasserstein 프록시 참조 구성해 다양성 저하 완화
왜 중요한가?
의료·금융 등 데이터를 모을 수 없는 사일로 환경에서 데이터 선택이 붕괴 방지책이 아닌 붕괴 촉진제가 될 수 있음을 이론·실험으로 보여줘, 합성데이터 파이프라인 설계에 경고를 준다.
합성 데이터 재귀 학습 시 표본 선택 편향이 모델 붕괴를 초래할 수 있음을 경고하는 이 연구는 국내 AI 개발 커뮤니티에 중요한 경종을 울립니다. 데이터 부족을 해결하기 위한 합성 데이터 활용이 확산되는 한국 상황에서, AI 모델의 장기적인 안정성과 신뢰성을 확보하기 위한 정교한 데이터 관리 전략의 중요성을 강조합니다.
본문 미리보기
arXiv:2606.13732v1 Announce Type: new Abstract: The proliferation of recursive training on synthetic data can alleviate data scarcity but risks model collapse, where repeated training erodes distributional tails and homogenizes outputs. Data selection is widely viewed as a remedy, yet its reliability depends critically on the reference distribution used by the verifier. We show that in low-resource verification regimes, where each verifier observes only a small, fragmented, and biased slice of
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:49AI 초안

