이 논문은 프라이버시 평가는 통과했지만 관찰 가능한 채널이 검증되지 않은 2노드 분할 LLM 학습 시스템의 시스템 보안 사례 연구를 제시한다. 신뢰 로컬 노드(TLN)가 보호된 활성값을 신뢰되지 않은 클라우드 노드(UCN)로 보내고 UCN이 출력을 반환하면, 손실을 보유한 TLN이 출력 그래디언트를 반환하는 구조에서 UCN이 받는 프레임에는 실제 행과 더미(decoy) 행이 섞여 있는데, 손실이 더미를 무시하기 때문에 더미의 그래디언트는 정확히 0이 되어 어떤 행이 실제인지 드러난다. 9개 시드에 걸친 실험에서 이 '0의 패턴'은 매 프레임 4096개 중 4096개 모두에서 실제 행을 정확히 식별했으며, 프레임 내용에 대한 추가 공격은 상수 추정 베이스라인 대비 100개 중 약 1개의 토큰을 추가로 복구했다. 이 시스템은 순방향 채널 프라이버시 검사와 품질 검사를 모두 통과했음에도 반환된 그래디언트를 포함하자 같은 검사에서 실패했으며, 각 행의 그래디언트를 클리핑·노이즈 처리하면 누출을 막을 수 있었지만 다섯 가지 공격 유형은 여전히 검증되지 않은 채 남아 있다.
- •분할 LLM 학습에서 손실이 무시하는 더미 행의 그래디언트가 정확히 0이 되어 실제 행을 노출시키는 관찰 채널 발견
- •9개 시드 실험에서 매 프레임 4096개 중 4096개 실제 행을 100% 식별
- •순방향 채널 프라이버시·품질 검사는 통과했지만 반환 그래디언트를 포함하면 같은 검사에서 실패
- •행별 그래디언트 클리핑·노이즈로 누출은 막았으나 다섯 가지 공격 유형은 검증되지 않음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Privacy Failure in Split-LLM Training, The Returned Gradient Nullifies the Decoys
- 1.분할LLM 훈련에서 반환된 그래디언트가 디코이(가짜 데이터)를 무력화해 실제 데이터 행을 노출시킴을 실증
- 2.9개 시드 전 실험에서 4096개 프레임 전부 실제 행 식별 성공, 탐지율 100%
- 3.기존 프라이버시 검사(포워드 채널)는 통과했지만 그래디언트 포함 시 실패
- 4.그래디언트 클리핑·노이즈 처리로 누출은 막았으나 5종 공격은 미검증으로 남음
왜 중요한가?
분할 학습 시스템이 표준 프라이버시 검사를 통과해도 반환 그래디언트라는 사각지대를 통해 데이터가 유출될 수 있음을 보여, 프라이버시 평가 프로토콜 자체의 보완이 시급함을 시사한다.
본문 미리보기
arXiv:2609.04382v1 Announce Type: new Abstract: We present a systems-security case study of a two-node split-LLM training system whose privacy evaluation passed while leaving an observable channel untested. The Trusted Local Node (TLN) sends protected activations to the Untrusted Cloud Node (UCN), the UCN returns its output, and TLN, holding the private loss, returns the output gradient. The frame the UCN receives mixes real rows with decoys, and the loss ignores the decoys. Their gradients are
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
