연구진은 공급망이 침해된 오픈소스 컴포넌트를 통해 모델 파라미터에 민감한 학습 데이터를 직접 주입하는 새로운 공격 'GradLock'을 제시했다. 기존 모델 역전(model inversion) 공격이 학습 후 최적화에 의존해 모델의 일반화 병목 때문에 추상적인 특징만 복원했던 것과 달리, GradLock은 학습 시점에 상태 비저장 결정론적 인덱싱으로 격리된 데이터 저장소를 만들고 동적 그래디언트 잠금으로 최적화 과정에서 페이로드가 손상되지 않도록 한다. MNIST·Imagenette·CelebA 실험에서 SSIM 약 1.0의 거의 완벽한 픽셀 단위 복원을 1초 이내에 달성했으며, 양자화·프루닝·파인튜닝 같은 배포 최적화에도 기존 학습시점 주입 공격보다 강한 내성을 보였다. 사용자 배포 실험에서는 참가자의 93.3%가 악성 로직을 탐지하지 못해 AI 공급망 보안의 심각한 사각지대를 드러냈다.
- •공급망 침해로 학습 데이터를 모델 파라미터에 직접 주입하는 신규 공격 GradLock 제시
- •상태 비저장 결정론적 인덱싱과 동적 그래디언트 잠금으로 최종 모델에서 거의 완벽한 데이터 복원 가능
- •MNIST·Imagenette·CelebA에서 SSIM 약 1.0, 1초 이내 추출 달성, 양자화·프루닝에도 강한 내성
- •사용자 실험 참가자 93.3%가 악성 로직을 탐지하지 못해 AI 공급망 보안의 사각지대 노출
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Don't Trust the AI Ecosystem: Analyzing Privacy Leakage in Compromised Open-Source Components
본문 미리보기
arXiv:2607.27886v1 Announce Type: new Abstract: Existing model inversion (MI) attacks predominantly rely on post-training optimization to recover private data from model outputs. However, these methods are fundamentally constrained by the target model's generalization bottleneck, often yielding generic features rather than specific identities, particularly on high-dimensional datasets. In this paper, we introduce GradLock, a novel training-time injection attack that stealthily injects sensitive
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:06AI 초안



