LLM의 수학 학습 데이터를 고를 때 「같은 주제」보다 「같은 풀이 방법」을 공유하는 예제가 전이 학습 효과를 더 높인다는 것을 통제 실험으로 입증했다. 확률·조합론과 정수론·기하학을 교차시킨 두 개의 2×2 균형 설계로 같은 방법·다른 주제(SA) 데이터와 같은 주제·다른 방법(ST) 데이터의 전이 효과를 비교한 결과, 5개 모델·3개 시드로 구성된 40개 비교 전부에서 SA가 ST를 능가했다. 모델별 우위는 설계에 따라 평균 10.8%p~14.3%p에 달해 모든 95% 신뢰구간이 0을 배제했다. 흥미롭게도 임베딩·어휘 유사도로는 ST 데이터가 타깃과 더 유사했는데도 SA가 우세해, 수학 학습 데이터 선별 시 주제보다 풀이 방법 매칭이 더 중요한 기준이 될 수 있음을 시사한다.
- •40개 모델-타깃 비교 전부에서 같은 풀이법(SA) 데이터가 같은 주제(ST) 데이터보다 전이 효과가 우세
- •모델별 성능 우위는 설계에 따라 평균 10.8%p~14.3%p, 모든 95% 신뢰구간이 0을 배제할 만큼 뚜렷
- •임베딩·어휘 유사도에서는 ST가 타깃과 더 유사했음에도 SA가 더 큰 전이 효과를 보여 표면적 유사성과 반대 결과
- •수학 학습 데이터 선별 기준으로 주제보다 풀이 방법(reasoning approach) 매칭이 더 효과적임을 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mathematical Transfer in LLMs Follows Reasoning Approach More Than Topic
- 1.수학 LLM 파인튜닝 시 '주제'보다 '풀이방식 일치'가 전이 학습에 더 효과적
- 2.5개 기반 모델·3개 시드에서 동일방식(SA) 데이터가 전 40개 비교에서 동일주제보다 우세
- 3.설계1에서 8.2~16.2%p, 설계2에서 12.0~16.0%p 격차로 일관된 우위 확인
- 4.임베딩·어휘 유사도는 오히려 동일주제쪽이 높아, 표면 유사성과 전이효과가 반대로 나타남
왜 중요한가?
학습 데이터를 고를 때 '같은 주제'보다 '같은 풀이 절차'를 기준으로 삼아야 전이 성능이 높아진다는 실증 결과로, LLM 수학 추론 능력 향상을 위한 데이터 큐레이션 전략에 지침을 제공한다.
본문 미리보기
arXiv:2610.00331v1 Announce Type: new Abstract: When selecting mathematical training data for LLMs, a natural organizing principle is topic: probability examples for probability targets. An alternative is reasoning approach: worked solutions that share a solution method with the target, even when the mathematical domain differs. We ask which relation produces greater transfer after fine-tuning. We evaluate two counterbalanced $2\times2$ designs: probability and combinatorics crossed with invari
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

