이 논문은 Sparse Mixture-of-Experts(MoE) 구조에서 복잡한 라우팅 메커니즘(학습 라우터, 다중 홉 궤적, 토큰 의존 게이팅)이 실제로 언어 모델링 품질을 결정하는지 검증한다. 저자들은 저차원 공간의 코사인 유사도 라우팅을 쓰는 ST-MoE를 구축해 표준 라우터보다 파라미터 80% 적음에도 비슷한 성능을 냈다. WikiText-103에서 76~84M 파라미터로 62회 통제 실험한 결과, 라우팅 토폴로지가 점근 Perplexity를 결정하지 않음이 통계적으로 입증됐다(5개 코사인 변형이 1-PPL 이내 등가). 다중 홉 업데이트는 선형 종속적(cos 0.805)이라 크기 증폭일 뿐 구성적 추론이 아니었다.
- •MoE 라우팅 토폴로지가 언어 모델 품질을 결정하지 않음을 통계적으로 입증
- •코사인 라우팅(ST-MoE)으로 표준 라우터 대비 80% 적은 파라미터에도 동등 성능
- •62회 통제 실험·TOST 통계 검정으로 5개 변형이 1-PPL 이내 등가 확인
- •다중 홉 업데이트는 사실상 크기 증폭(collinear 0.805)이며 구성적 추론 아님
- •zero-shot relative-norm halting으로 MoE FLOPs 25% 절감(+0.12% PPL만 희생)
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Equifinality in Mixture of Experts: Routing Topology Does Not Determine Language Modeling Quality
- 1.MoE의 정교한 라우팅은 과대평가됐으며 단순 코사인으로 충분
- 2.실용 효과: 라우팅 파라미터 80% 삭감 + FLOPs 25% 절감 가능
- 3.다중 홉 구조는 새 추론이 아닌 스칼라 증폭과 기능적 동등
왜 중요한가?
MoE는 현재 프론티어 모델(GPT-4, Mixtral, DeepSeek)의 핵심 아키텍처인데, 라우팅 복잡도가 품질을 결정하지 않는다는 이 결과는 향후 MoE 설계·비용 최적화에 직접적 시사점을 준다.
본문 미리보기
arXiv:2604.14419v1 Announce Type: new Abstract: Sparse Mixture-of-Experts (MoE) architectures employ increasingly sophisticated routing mechanisms -- learned routers, multi-hop trajectories, token-dependent gating. We ask: does routing topology actually determine language modeling quality? We build a geometric MoE (ST-MoE) using cosine-similarity routing against learned centroids in a low-dimensional space ($d_{space} = 64$), requiring 80% fewer routing parameters than standard linear routers.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 22:30AI 초안

