연구팀이 Qwen3.6-35B-A3B 모델(MoE 레이어 40개, 레이어당 전문가 256개, 상위 8개 라우팅)을 대상으로 크기 기반 전문가 마스킹을 이용한 레이어별 민감도 분석을 수행했다. XLCoST 코드 번역 벤치마크에서 H100 서버 3대로 100~500개 프롬프트 규모의 다단계 실험을 진행한 결과, 초기 레이어(0~9)와 중간 레이어(10~29)는 마스킹에 매우 취약한 반면, 후반 레이어(30~39), 특히 35~39번 레이어는 저강도 전문가를 공격적으로 마스킹해도 잘 견뎠다. 전 레이어를 균일하게 30% 마스킹하면 300개 프롬프트 중 150개만 양호한 결과를 유지했지만, 후반 레이어에 집중한 마스킹은 640~1145개 전문가를 제거하고도 249~255개를 유지했다. 500개 프롬프트 검증에서는 35~39번 레이어의 50% 마스킹이 전체 1만240개 전문가 중 640개만 제거하고도 419개의 양호한 결과를 유지해 가장 우수한 품질 대비 압축 효율을 보였다.
- •Qwen3.6-35B-A3B 모델의 40개 MoE 레이어를 대상으로 크기 기반 전문가 마스킹 민감도를 체계적으로 분석.
- •초기(0~9)·중간(10~29) 레이어는 마스킹에 취약하고, 후반(30~39) 레이어, 특히 35~39번은 공격적 마스킹에도 강함.
- •전 레이어 균일 30% 마스킹은 품질 손실이 크지만, 후반 레이어 집중 마스킹은 더 많은 전문가를 제거하고도 품질 유지.
- •500프롬프트 검증에서 35~39번 레이어 50% 마스킹이 전체 전문가의 6.25%만 제거하고 최상의 품질-압축 균형 달성.
- •top-k 라우팅을 8에서 6으로 줄이면 지연시간이 크게 감소하나 공격적 마스킹과는 아직 잘 결합되지 않음.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking
본문 미리보기
arXiv:2608.13565v1 Announce Type: new Abstract: Mixture-of-Experts (MoE) architectures scale large language models (LLMs) while preserving computational efficiency through sparse activation. Despite their widespread adoption, the relative importance of individual MoE layers remains insufficiently characterized, particularly for model compression. This paper presents a systematic layer-wise sensitivity analysis of the Qwen3.6-35B-A3B model (40 MoE layers, 256 experts per layer, top-8 routing) us
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

