데이터 기여자가 삭제를 요청해도 어떤 학습 레코드가 그 저자의 것인지 찾아낼 도구가 없어 언러닝의 forget set을 만들 수 없다는 실무 공백을 겨냥한 레코드·토큰 수준 데이터 계보(provenance) 시스템 연구다. 기존 계보 시스템은 파일·데이터셋 단위여서 과도한 삭제를 강요하지만, 제안 시스템은 데이터 처리 파이프라인 전체에 저자 정보를 전파하고 결정론적 쿼리로 삭제 요청을 정밀한 forget set으로 변환한다. 위키피디아 21만 9,555개 페이지 평가에서 과잉 삭제를 101배에서 1.3배로 줄였고, 통합 오버헤드는 HuggingFace 파이프라인에서 1.3~4.0%, Datatrove에서 2.1~19.0% 수준이었다. 1.7B 모델에서는 계보 기반 forget set이 무작위 대비 언러닝 성능을 42% 개선해, 삭제권 대응과 머신 언러닝을 잇는 실용 인프라 가능성을 보여준다.
- •파이프라인 전체에 저자 정보를 전파하는 레코드·토큰 수준 데이터 계보 시스템 제안
- •삭제 요청을 결정론적 쿼리로 정밀 forget set으로 변환 — 기존 파일/데이터셋 단위 과잉 삭제 문제 해소
- •위키피디아 219,555페이지에서 과잉 삭제 101배→1.3배로 감소
- •통합 오버헤드: HuggingFace 1.3~4.0%, Datatrove 2.1~19.0%
- •1.7B 모델에서 계보 기반 forget set이 무작위 대비 언러닝 성능 42% 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OriginBlame: Record- and Token-Level Data Provenance for AI Training Datasets
- 1.레코드·토큰 단위 학습 데이터 출처 추적 시스템 OriginBlame(ob) 제안
- 2.데이터 파이프라인을 통해 저자 신원을 전파, 삭제 요청을 정밀한 forget set으로 변환
- 3.위키피디아 21만 페이지서 과잉 삭제 101배→1.3배, 처리량 오버헤드 1.3~19%
- 4.1.7B 모델에서 출처 기반 forget set이 랜덤 대비 언러닝 효과 42% 향상
왜 중요한가?
저작권·개인정보 삭제 요청이 늘어나는 상황에서 언러닝 알고리즘과 실제 데이터 관리 사이의 공백 — '어떤 레코드를 지워야 하는지' — 를 메운 시스템으로, 파일 단위 추적의 파국적 과잉 삭제 문제를 실측으로 해결해 데이터 거버넌스 실무에 직접 적용 가능하다.
AI 학습 데이터셋에서 개별 기록 단위의 데이터 출처를 추적하는 OriginBlame 기술이 소개되었습니다. 한국의 강력한 개인정보보호법(PIPA)에 따라 '잊힐 권리' 요청이 증가하는 상황에서, 이러한 세밀한 데이터 출처 관리 기술은 윤리적 AI 개발 및 규제 준수에 매우 중요한 역할을 할 것입니다.
본문 미리보기
arXiv:2607.13037v1 Announce Type: new Abstract: When a data contributor requests removal, model trainers face a practical gap: unlearning algorithms require a forget set, yet no tool can locate which training records belong to a given author. Existing provenance systems operate at file or dataset level, forcing catastrophic over-deletion. We present ob, a record- and token-level data provenance system that propagates author identity through data processing pipelines and resolves revocation requ
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

