이 논문은 금융 머신러닝에서 합성 데이터 증강이 언제 도움이 되고 언제 해가 되는지 통계적으로 정식화한다. 합성 증강을 효과적 학습 분포의 수정으로 해석하고, 이것이 구조적 편향-분산 트레이드오프를 일으킴을 보인다. 크기 일치 null 증강과 유한 샘플 블록 순열 검정으로 기계적 샘플 수 효과와 정보적 이득을 분리한다. 부트스트랩, 코퓰라, VAE, 디퓨전, TimeGAN 등 다양한 생성기를 Markov-switching 환경과 고빈도 옵션·일간 주식 패널에서 평가한 결과, 합성 증강은 분산 지배 영역(지속 변동성 예측)에서만 이득이고 편향 지배 영역(방향 예측)에서는 성능을 악화시킨다.
- •금융 ML에서 합성 데이터 증강을 통계적 프레임워크로 정식화
- •편향-분산 트레이드오프로 증강 효과를 분해 분석
- •bootstrap/copula/VAE/diffusion/TimeGAN 5종 생성기 비교
- •분산 지배 영역(변동성 예측)만 이득, 편향 지배 영역(방향 예측)은 악화
- •희귀 레짐 타겟팅으로 도메인 지표는 개선 가능하나 무조건 순열 추론과 충돌
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Improving Machine Learning Performance with Synthetic Augmentation
- 1.금융 AI에서 합성 데이터 증강의 효과를 이론·실증으로 규명
- 2.변동성 예측엔 유용, 방향 예측엔 역효과
- 3.다양한 생성기(diffusion·TimeGAN 등)가 비슷한 구조적 한계 공유
왜 중요한가?
금융 AI의 데이터 부족을 풀기 위해 합성 증강이 널리 쓰이지만 검증 없이 적용되는 경우가 많다. 이 논문은 언제 효과적이고 언제 역효과인지 수학적·실증적으로 가이드라인을 제시.
언급 프로젝트
본문 미리보기
arXiv:2604.14498v1 Announce Type: new Abstract: Synthetic augmentation is increasingly used to mitigate data scarcity in financial machine learning, yet its statistical role remains poorly understood. We formalize synthetic augmentation as a modification of the effective training distribution and show that it induces a structural bias--variance trade-off: while additional samples may reduce estimation error, they may also shift the population objective whenever the synthetic distribution deviat
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 22:30AI 초안

