연구진은 MoE(전문가 혼합) 모델을 서빙하는 익스퍼트 병렬처리(EP) 환경을 겨냥한 공급망 공격 'Load Hijack'을 제시했다. 악의적인 모델 제공자가 체크포인트의 라우터 가중치만 변형해 배포하고 비공개 트리거를 보유하면, 해당 트리거가 입력될 때 라우터가 토큰 배정을 특정 GPU에 몰린 전문가들로 집중시켜 그 GPU를 병목(straggler)으로 만들고 다른 GPU들을 대기시킨다. 일반 입력에 대해서는 라우팅이 정상 기준과 거의 동일하게 유지되도록 3단계 최적화 절차를 설계해 트리거 의존적 집중과 은닉성을 동시에 달성했다. 3개 MoE 모델군과 4개 데이터셋에서 트리거 입력의 92.3~95.6%를 목표 전문가로 유도했으며, 실제 EP 서빙 환경에서는 트리거 트래픽이 정상 대비 첫 토큰 생성 시간 1.43배, 처리량 0.86배로 저하돼 체크포인트의 라우팅 감사가 필요함을 시사했다.
- •체크포인트 라우터 가중치만 변형해 배포하는 공급망 공격 'Load Hijack' 제시
- •트리거 입력 시 특정 GPU에 부하를 집중시켜 병목으로 만드는 방식
- •3개 MoE 모델군·4개 데이터셋에서 트리거 입력의 92.3~95.6%를 목표 전문가로 유도
- •트리거 트래픽 시 첫 토큰 생성 시간 1.43배 증가, 처리량 0.86배로 저하
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Trigger the Straggler: Load Hijack on Mixture-of-Experts LLMs
본문 미리보기
arXiv:2608.10614v1 Announce Type: new Abstract: Expert parallelism (EP) is a common strategy for serving large Mixture-of-Experts (MoE) models across multiple GPUs by distributing experts among devices. Router decisions then determine both which experts process each token and which GPUs execute the resulting work. This procedure exposes a supply-chain attack surface in the serving schedule. We introduce Load Hijack, in which a malicious model provider modifies only a checkpoint's router weights
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안



