이 논문은 연합학습에서 공유 그래디언트로부터 원본 텍스트를 거의 완벽하게 복원하는 그래디언트 역전 공격의 세 가지 유출 경로를 트랜스포머 구조 분석을 통해 규명했다. 어텐션 출력 투영 그래디언트가 입력 임베딩을 담은 저차원 부분공간을 노출하는 채널1, 임베딩 그래디언트의 행별 희소성이 어떤 토큰이 존재하는지 드러내는 채널2, MLP 확장 그래디언트가 채널1과 유사한 복원 가능 신호를 담는 채널3이다. 연구진은 이 세 채널을 모두 차단하는 경량 방어 기법 AEGIS를 제안했는데, 어텐션 투영 파라미터를 고정해 채널1을 원천 제거하고 임베딩·MLP 그래디언트에 보정된 노이즈를 주입해 채널2·3을 각각 차단한다. 11개 모델과 6개 데이터셋 평가에서 AEGIS는 토큰 복원율을 거의 0으로 낮추면서도 모델 성능을 유지하거나 개선했으며, 메커니즘을 완전히 아는 적응형 공격자에게도 효과가 검증됐다.
- •트랜스포머 그래디언트 역전 공격의 3가지 유출 채널(어텐션 투영·임베딩 희소성·MLP 확장)을 규명
- •경량 방어 기법 AEGIS, 파라미터 고정과 보정 노이즈 주입만으로 아키텍처 변경 없이 3채널 모두 차단
- •11개 모델·6개 데이터셋 평가에서 토큰 복원율을 거의 0으로 낮추면서 모델 성능 유지·개선
- •메커니즘을 아는 적응형 공격자 대상 실험에서도 방어 효과 검증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AEGIS: Attention-Embedding Gradient Isolation Shield - Triple-Channel Gradient Masking for Privacy-Preserving Federated LLM Fine-Tuning
- 1.트랜스포머 그래디언트에서 비밀 토큰이 새는 3개 채널(어텐션투영·임베딩·MLP확장)을 분석으로 규명
- 2.AEGIS 제안: 어텐션 프로젝션 동결으로 채널1 차단, 보정된 잡음 주입으로 채널2·3 차단 (아키텍처 변경 불필요)
- 3.11개 모델, 6개 데이터셋에서 분석·최적화 기반 공격 모두에 토큰 복원율을 거의 0으로 낮춤
- 4.유킨성을 유지·어향 측정 공장하면서 채널1·2에 대해 형식적 보장까지 제시
왜 중요한가?
기존 방어는 그래디언트 유출 경로 하나만 막거나 모델 성능을 희생했는데, AEGIS는 아키텍처 변경 없이 세 유출 경로를 동시에 차단하면서 성능까지 보존해 연합학습 프라이버시 방어의 실용성을 크게 높인다.
언급 프로젝트
본문 미리보기
arXiv:2608.19534v1 Announce Type: new Abstract: Gradient inversion attacks recover private training text from gradients shared in federated learning, posing a serious threat to collaborative model training. Through our analysis of transformer gradient structure, we identify three channels through which private token information leaks: the attention output projection gradient exposes a low-rank subspace that encodes input embeddings (Channel 1), the embedding gradient's row-norm sparsity directl
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
