동일한 문제를 서로 다른 두 표기 관례로 학습시킬 때, 데이터 순서가 모델에 무엇을 새기는지를 결정하는 것은 학습률 스케줄이라는 것을 규명했다. 배열과 스케줄이 각각 독립적인 곱셈 인자로 「순서 효과」에 들어가며, 감쇠 스케줄은 큰 스텝과 수축되지 않은 잔여값을 같은 순간에 둘 수 없지만 상수 스케줄은 마지막 스텝에서 그렇게 한다. 10가지 순서를 두 스케줄로 실행한 결과, 상수 학습률에서는 뚜렷한 순서 효과가 나타났지만 표준 코사인 스케줄에서는 10개 상태가 단 2개로 수렴했다. 12개 조건에서 합산 정확도는 9.7% 이내로 일정했던 반면 할당 비율은 0.04~0.87로 크게 변동했으며, 프롬프트에 관례를 명시하면 이 전환이 무너지고 합집합 상한의 87.5%에 도달했다.
- •데이터 순서가 모델에 새기는 '관례 선택'을 결정하는 것은 배경 조건이 아니라 학습률 스케줄 자체임을 증명
- •상수 학습률에서는 뚜렷한 순서 효과가 나타나지만 표준 코사인 스케줄에서는 10개 상태가 단 2개로 수렴
- •12개 조건에서 두 관례의 합산 정확도는 9.7% 이내로 일정하나 개별 할당 비율은 0.04~0.87로 크게 변동
- •프롬프트에 표기 관례를 명시하면 순서 효과가 사라지고 합집합 상한의 87.5%까지 도달
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Conflicting Supervision Moves Commitment, Not Capability: A 12.29{\sigma} arrangement effect that is exactly zero under a convention-agnostic score
- 1.동일 문제를 두 호환 불가 표기 관례로 학습시킬 때, 학습률 스케줄이 어느 관례에 정착할지 결정함을 증명
- 2.상수 학습률에서는 배치 순서에 따라 배분 비율이 0.2221 범위로 변동
- 3.코사인 스케줄에서는 10개 순서가 원래 10개 상태 대신 2개 상태로만 수렴
- 4.12개 실험에서 정답률 합은 9.7% 이내로 일정하지만 관례 배분은 0.04~0.87로 요동—프롬프트에 관례 명시 시 상한의 87.5% 회복
왜 중요한가?
같은 데이터를 어떤 순서·스케줄로 학습시키느냐가 모델이 어떤 '규칙'에 정착하는지를 바꾼다는 것을 보여, 정확도만 보는 벤치마크가 놓치는 학습 동역학의 숨은 편향을 드러낸다.
본문 미리보기
arXiv:2610.00234v1 Announce Type: new Abstract: "Train a model on the same problems written under two incompatible conventions, both correct, and ask what the ordering of that data writes into the parameters. The learning-rate schedule is not a background condition for that question. It is the averaging operator, and it decides the answer. We prove a bound in which the arrangement and the schedule enter the ordering effect as separate multiplied factors: the arrangement only as a block period,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

