TAC(Transfer-Aware Curriculum)는 수학·프로그래밍·과학 등 다중 도메인 RLVR 학습에서 도메인 샘플링 비율을 자동 조정하는 밴딧 방식 온라인 커리큘럼이다. 기존 학습가능성 기반 커리큘럼이 현재 정책이 향상되는 도메인만 보는 것과 달리, 선택한 도메인의 그래디언트 업데이트가 나머지 도메인에도 도움이 되는지(전이성)를 함께 고려한다. RL 학습이 이미 산출하는 신호를 재활용해 도메인별 어드밴티지로 국소 학습가능성을, GRPO 스텝의 투영 그래디언트 정렬로 교차 도메인 전이성을 추정하며 추가 비용은 벽시계 시간 1% 미만이다. 6개 도메인 스위트에서 Qwen3-1.7B와 Llama3.2-3B 모두 최고 매크로 평균 정확도를 기록했고, 학습가능성 전용 밴딧 대비 최대 2.8점(상대 10%) 개선했다. 교차 도메인 전이성이 다중 도메인 RLVR 커리큘럼 설계의 핵심 신호임을 보여준다.
- •도메인 업데이트가 다른 도메인에 주는 이득(전이성)까지 고려하는 밴딧 온라인 커리큘럼 TAC
- •도메인별 어드밴티지 + GRPO 투영 그래디언트 정렬로 전이성 추정, 추가 비용 1% 미만
- •6개 도메인 스위트에서 Qwen3-1.7B·Llama3.2-3B 모두 최고 매크로 평균 정확도
- •학습가능성 전용 밴딧 대비 최대 +2.8점(상대 10%) 개선
- •불균형 학습 혼합에서도 강건 — 전이성 항 제거 시 성능 급락(절젠 확인)
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR
- 1.다중 도메인 RLVR에서 도메인 샘플링 커리큘럼을 자동 조정하는 TAC 제안
- 2.기존 학습가능성 커리큘럼과 달리 도메인 간 전이 효과까지 고려
- 3.GRPO 그래디언트 정렬로 교차 전이성 추정, 원감 1% 미만 오버헤드
- 4.6개 도메인에서 Qwen3-1.7B·Llama3.2-3B 최고 성능, 최대 2.8점 개선
왜 중요한가?
수학·코딩·과학 등 다영역 추론 RLVR에서 도메인 학습 순서가 보통 고정·수동 튜닝에 머무는데, TAC는 '한 도메인 업데이트가 나머지 도메인에 도움이 되는가'라는 전이성 신호를 RL이 이미 만든 값(어드밴티지·투영 그래디언트)에서 거의 공짜로 뽑아낸다. 전이성 항을 빼면 성능이 급락해, 커리큘럼 설계의 핵심 신호임을 입증한다.
언급 프로젝트
본문 미리보기
arXiv:2606.25178v1 Announce Type: new Abstract: Reinforcement learning with verifiable rewards (RLVR) has been extended from single-domain training to multi-domain reasoning suites spanning mathematics, programming, and science. However, the training curriculum (how often each domain is sampled) is typically fixed or hand-tuned, even though reasoning skills transfer unevenly across domains. Existing learnability-based curricula adapt to where the policy is currently improving, but are blind to
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

