SynthGuard-ReleaseBench는 합성 표 데이터의 릴리스 가능 여부를 사실성·프라이버시·다운스트림 점수만으로는 답할 수 없다는 문제의식에서, 평가 전에 용도·후보 패널·허용 오차·감사 일정을 고정하는 감사 프레임워크를 제안한다. 실제 학습 모델과 합성 학습 모델을 보호 데이터에서 비교하고, 유한 표본 손실 격차에 동시 신뢰구간을 제공하며, 대조군을 요구하고 유용성·경험적 프라이버시 위험·메커니즘 주장·인간의 릴리스 권한을 분리해 다룬다. 미국 인구조사 4건, 비ACS 기록 5건, 시계열 진단 2건과 봉인 프로토타입을 대상으로 한 실험에서 투명한 기준선은 일부 잠긴 감사를 통과했지만 압축 학습 모델은 정해진 예산 아래 실패했고, 사후 감사 스케일링 실험은 동일 기준이 판별력을 유지함을 보였다. 이는 특정 생성기가 안전하다는 주장이 아니라 용도별 릴리스 근거를 위한 재현 가능한 워크플로를 제공하는 것이 기여점이다.
- •평가 전 용도·패널·허용오차·감사 일정을 고정하는 감사 프레임워크 제안
- •실제·합성 학습 워크플로우를 보호 데이터에서 비교하고 유한 표본 신뢰구간 제공
- •미국 인구조사 등 11건 사례에서 투명 기준선은 통과, 압축 학습 모델은 실패
- •사후 감사 스케일링 실험으로 기준이 단순 거부가 아니라 판별력을 갖춤을 확인
- •괴대적·시간 인증 인증서와 패널 크기 보정 하한 이론 제공
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SynthGuard-ReleaseBench: Locked-Audit Evidence for Synthetic Tabular Data Releases
- 1.SynthGuard-ReleaseBench, 합성 표형데이터 공개 전 용도·집단·위협모델을 사전에 고정하는 감사 프레임워크
- 2.미국 인구조사(ACS) 4개 연구 등에서 투명 베이스라인은 통과, 소형 학습모델은 정해진 예산 기준에서 실패
- 3.사전 표본크기 규칙과 분산적응형 언제나유효한 인증서로 기존 대비 경계를 2~10배 정교화
왜 중요한가?
합성 데이터의 '현실성 점수'만으로는 실제 공개 승인 여부를 판단할 수 없다는 문제의식에서, 재현 가능한 감사 절차를 표준화했다는 점에서 프라이버시 규제 대응에 실무적 가치가 있다.
언급 프로젝트
본문 미리보기
arXiv:2608.14753v1 Announce Type: new Abstract: Synthetic tabular data are often judged by realism, privacy, or downstream-task scores. Those scores do not answer whether a proposed release is supported for a named use, population, and threat model. We introduce SynthGuard-ReleaseBench, an audit framework that locks the use, candidate panel, tolerances, and audit schedule before evaluation. It compares real-trained and synthetic-trained workflows on protected data, gives simultaneous finite-sam
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
