이 논문은 배포 후 은밀히 변경된 LLM을 탐지하기 위한 프라이버시 보존형 zk-SNARK 감사 프레임워크를 제안한다. 모델 가중치가 비공개인 상황에서도 승인된 모델과 실제 배포 모델 간 로짓 차이를 증폭시키는 적대적 프로브를 설계해, 블랙박스(토큰 기반)부터 그레이박스(임베딩 기반), 화이트박스에 가까운 스트레스 프로브까지 접근 수준별로 선택할 수 있게 했다. 여러 LLM 아키텍처와 GPU 플랫폼, 모델 변조 시나리오에서 실험한 결과 별도의 모델 접근 권한 없이 작동하는 토큰 기반 프로브가 가장 높은 평균 민감도를 보였다. Groth16 zk-SNARK 워크플로는 프로브 개수를 1개에서 50개로 늘려도 증명 시간이 1.02~1.78초, 검증 시간은 약 0.84초로 일정하게 유지되어 실용적임을 입증했다.
- •적대적 예제 원리를 응용해 승인 모델과 변조 배포 모델 간 로짓 드리프트를 증폭하는 프로브를 설계
- •토큰 기반(블랙박스), 임베딩 기반(그레이박스), 스트레스(화이트박스급) 등 접근 수준별 프로브 패밀리 제공
- •블랙박스 접근만으로 작동하는 토큰 기반 프로브가 모든 모델·GPU 조합에서 가장 높은 민감도 기록
- •Groth16 zk-SNARK는 프로브 50개까지 확장해도 증명 1.78초, 검증 0.84초, 고정 증명 크기로 실용성 확보
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Not to Break, but to Attest: Adversarial Probes for Privacy-Preserving LLM Verification
- 1.배포 후 LLM 변조를 탐지하는 프라이버시 보존 zk-SNARK 감사 프레임워크 제안
- 2.토큰·임베딩·스트레스 등 접근수준별 적대적 프로브로 로짓 드리프트 증폭
- 3.블랙박스 토큰 프로브가 전 모델·GPU에서 가장 강력한 탐지 민감도 기록
- 4.Groth16 워크플로우로 프로브 50개까지 확장해도 증명시간 1.78초·검증 0.84초로 실용적
왜 중요한가?
모델 가중치가 비공개인 상황에서도 배포 후 변경을 영지식증명으로 검증할 수 있어, AI 거버넌스와 모델 공급망 신뢰 확보에 실전적인 감사 수단을 제공한다.
상용 LLM의 배포 후 행동 변화를 검증하는 것은 AI 거버넌스에서 중요한 과제이며, 국내에서도 AI 서비스의 신뢰성 확보가 강조되고 있습니다. 이 연구는 zk-SNARK 기반의 프라이버시 보호 감사 프레임워크를 제안하여, 모델 소유자의 영업 비밀을 침해하지 않으면서도 LLM의 투명하고 윤리적인 운영을 검증할 수 있는 가능성을 열어줍니다. 이는 국내 AI 서비스의 책임성을 강화하고 사용자 신뢰를 구축하는 데 핵심적인 기술이 될 것입니다.
본문 미리보기
arXiv:2608.27954v1 Announce Type: new Abstract: Post-deployment changes to large language models can alter behavior while leaving routine outputs largely unchanged, creating a challenge for AI governance when model weights are proprietary. We present a privacy-preserving zk-SNARK-based audit framework that searches for probes designed in the spirit of adversarial examples to amplify logit drift between an approved model and a modified deployment. Our framework explores complementary probe famil
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안



