벤치마크 실패에서 데이터 수정으로 이어지는 추론을 직관이 아닌 방법론으로 만드는 '데이터-평가 폐루프'를 제안한 논문이다. 배경 조건·과제 유형·풀이 연산·출력 제약을 공유하는 평가 샘플 그룹인 'capability slice'를 단위로 삼아, 평가 분류체계와 비지시 데이터 분류체계, 매핑 규칙으로 벤치마크 수준 실패를 검증 가능한 데이터 개입으로 전환한다. 사례 연구에서 이 루프는 정반대 결론을 모두 올바르게 내렸다. 계속 사전학습으로 BBH가 -46.82% 하락한 원인을 데이터가 아닌 마스킹된 EOS 손실로 진단해 복구 후 66.44로 원래 체크포인트 이상을 회복했고, 수학 추론 약점은 풀이 연산별로 분해해 약점 표적 샘플링으로 AIME2025/2026 Pass@128을 6.67/0.00에서 각각 26.67로 끌어올렸다. 평가→데이터 추론이 감이 아니라 감사 가능하고 실험으로 검증되는 절차가 될 수 있음을 보여준다.
- •벤치마크 이름(너무 거침)과 단일 샘플(너무 노이즈) 사이의 진단 단위 'capability slice' 제안
- •BBH -46.82% 하락의 원인을 데이터가 아닌 마스킹된 EOS 손실로 진단, 데이터 변경 없이 66.44로 회복
- •약점 표적 샘플링으로 AIME2025/2026 Pass@128을 6.67/0.00에서 각각 26.67로 향상
- •동일한 루프가 '데이터 문제 맞다/아니다' 양방향 판정을 모두 올바르게 수행
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Data and Evaluation Closed-Loop for Model Capability Enhancement
- 1.평가 실패를 데이터 개입으로 연결하는 폐루프 방법론 제안, 핵심 단위는 '능력 슬라이스'
- 2.능력 슬라이스는 배경·과제유형·풀이연산·출력제약을 공유해 단일 약점을 국화
- 3.사례1: BBH -46.82% 하락 원인을 EOS 손실 마스킹으로 진단, 데이터 수정 없이 66.44로 회복
- 4.사례2: 약점 표적 샘플링으로 AIME2025/2026 Pass@128를 6.67/0에서 각각 26.67로 향상
왜 중요한가?
벤치마크 실패에서 어떤 데이터를 고쳐야 할지 추론하는 일은 그동안 직관에 의존했는데, 이를 감사 가능하고 실험으로 검증되는 정례 절차로 바꿨다. 동일한 루프가 데이터를 '배제'와 '채택' 양방향에서 모두 정답 판정에 도달해 평가-데이터 추론의 방법론화를 실증했다.
본문 미리보기
arXiv:2606.28471v1 Announce Type: new Abstract: Model capability is the central variable in LLM pre-training, yet is never observed directly: data shapes it prospectively, while evaluation reveals it only retrospectively, compressing samples, prompts, decoding, and scoring rules into one noisy score. Practical optimization runs this backward: a failure is observed first, and the engineer must infer the corpus fix. The two sides speak incompatible vocabularies -- benchmark names and per-sample c
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

