합성 유전자 발현 데이터의 프라이버시를 감사하는 멤버십 추론 공격(MIA) 통합 프레임워크가 제안됐다. TCGA 유래 벌크 RNA-seq 데이터를 대상으로 균일 가중치, 분산 가중치, KL 발산, 스펙트럼 잔차화, 생물학적 경로 가중치 등 5종의 노박스 공격을 하나의 가중 거리 프레임워크로 통합했다. 조건부 변분 오토인코더를 대상으로 한 실험에서 스펙트럼 잔차화 기법이 AUC를 0.8251에서 0.8951로, 1% 거짓양성률에서의 재현율을 0.3842에서 0.5970으로 끌어올렸다. 반면 생물학적 경로 사전지식은 다른 공격 대상에는 잘 전이되지 않았다.
- •5종의 노박스 멤버십 추론 공격을 하나의 가중 거리 프레임워크로 통합
- •스펙트럼 잔차화 적용 시 AUC 0.8251→0.8951, 1% FPR 재현율 0.3842→0.5970으로 상승
- •TCGA 범암종 데이터와 조건부 변분 오토인코더 대상 실험에서 검증
- •생물학적 경로 기반 가중치는 다른 타깃으로 전이되지 않음을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Auditing the Privacy of Synthetic Gene Expression Data: A Unified Weighted-Distance Framework for No-Box Membership Inference
- 1.TCGA 유래 합성 유전자발현 데이터의 프라이버시를 멤버십추론공격(MIA)으로 레드팀 검증, ELSA Health 2026 챌린지 데이터 활용
- 2.균등·분산·KL발산·스펙트럴 잔차화·경로기반 가중 등 5가지 노박스 공격을 하나의 가중거리 프레임워크로 통합
- 3.조건부 VAE 대상 스펙트럴 잔차화 적용 시 AUC 0.8251→0.8951, 1% FPR서 TPR 0.3842→0.5970으로 공격력 상승
- 4.생물학적 경로 사전지식 기반 가중은 다른 타깃으로 전이되지 않아 범용성이 떨어짐을 확인
왜 중요한가?
합성 유전체 데이터가 통제접근 저장소의 프라이버시 대안으로 제시되는데, 특정 가중방식이 멤버십추론 공격력을 눈에 띄게 높일 수 있음을 보여 합성데이터의 프라이버시 안전성 주장에 실증적 반증 사례를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2610.04060v1 Announce Type: new Abstract: Synthetic gene expression data is increasingly proposed as a privacy-preserving substitute for controlled-access genomic repositories, but its safety depends on empirical auditing. Membership inference attacks (MIAs) provide that audit by testing whether a patient's gene expression profile was used to train a generative model. We report a red-team study on synthetic gene expression data derived from bulk RNA-seq profiles in The Cancer Genome Atlas
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

