MSIFR(Multi-Stage In-Flight Rejection)은 LLM 합성 데이터 생성 시 저품질 출력을 중간 단계에서 조기 종료하는 경량·무훈련 프레임워크다. 산술 불일치, 환각 패턴, 형식 위반을 감지하는 규칙 기반 검증기를 적용하여 불필요한 토큰 낭비를 줄인다. 마팅게일 속성 증명으로 조기 거절이 유지된 샘플의 기대 유용성을 편향시키지 않음을 보였다. 5개 모델·7개 벤치마크에서 단독으로 11~77%, 조기 종료 방법과 결합 시 최대 78.2%의 토큰 소비를 줄이면서 정확도를 유지했다.
- •생성 과정을 단계로 분해하고 규칙 기반 검증기로 중간에 저품질 생성을 조기 종료
- •추가 학습 없이 토큰 소비를 11~77% 감소, 조기 종료와 결합 시 최대 78.2% 감소
- •마팅게일 속성으로 조기 거절이 유지된 샘플의 기대 유용성에 편향을 주지 않음을 이론적으로 증명
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection
- 1.MSIFR은 LLM 합성 데이터 생성 시 중간 체크포인트에서 저품질 생성을 조기 종료하는 경량 프레임워크
- 2.규칙 기반 검증기로 산술 오류·환각·포맷 위반을 조기 감지해 불필요한 토큰 낭비 차단
- 3.5개 모델, 7개 벤치마크에서 토큰 소비 11~77% 절감하며 평가 정확도 유지 또는 향상
왜 중요한가?
추가 학습 없이 합성 데이터 생성 효율을 대폭 개선해 대규모 포스트트레이닝 파이프라인의 비용 절감에 실질적으로 기여한다.
언급 프로젝트
본문 미리보기
arXiv:2605.14062v1 Announce Type: new Abstract: While synthetic data generation with large language models (LLMs) is widely used in post-training pipelines, existing approaches typically generate full outputs before applying quality filters, leading to substantial token waste on samples that are ultimately discarded. To address this, we propose Multi-Stage In-Flight Rejection (MSIFR), a lightweight, training-free framework that detects and terminates low-quality generation trajectories at inter
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

