이 연구는 스파스 MoE 모델에서 인가된 요청만 새로 학습된 전문가(expert) 파라미터에 접근할 수 있도록 하는 '정책 마스킹 비공개 전문가' 기법을 제안한다. 사전학습된 MoE를 고정한 채 별도의 전문가 브랜치를 학습시키고 top-k 라우팅 전에 공개/비공개 풀을 선택하는 방식으로, Qwen3-30B-A3B와 DeepSeek-V2-Lite에서 검증했다. 64개의 적대적 시나리오와 96개의 거부 이벤트 전체에서 비인가 비공개 전문가 실행이 0건이었고, 비공개 브랜치는 정확한 도구 사용을 5.0~21.3%포인트 개선했으며 DeepSeek에서는 27.0%포인트 향상됐다. 동일 파라미터 규모의 LoRA는 비슷한 외부 효용을 보였지만 사후 요청 게이트로는 1,225건의 어댑터 호출이 거부 상태로 남은 반면, 분리된 전문가 브랜치는 하나도 남기지 않아 감사 가능하고 되돌릴 수 있는 접근 통제 방식임을 입증했다.
- •MoE 라우팅 전에 공개/비공개 전문가 풀을 나누는 접근 통제 기법
- •64개 적대적 시나리오·96개 거부 이벤트 전부에서 비인가 실행 0건
- •비공개 브랜치가 정확한 도구 사용을 최대 27.0%p 개선
- •LoRA 대비 사후 거부 잔여 호출이 0건으로 더 완전한 감사 가능성 확보
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Policy-Masked Private Experts: Auditable and Reversible Capability Access Control in Sparse MoE Models
본문 미리보기
arXiv:2608.06690v1 Announce Type: new Abstract: Most language-model access controls regulate behavior while leaving the same computation available to every request. We study a different systems question: can trusted authorization determine which newly trained parameters are reachable by the forward pass? Policy-Masked Private Experts freezes a pretrained sparse Mixture-of-Experts (MoE) model, trains a disjoint expert branch, and selects the public or private pool before top-k routing. The resul
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



