OpenAI Privacy Filter는 비정형 텍스트에서 개인식별정보(PII)와 비밀정보를 탐지·수정하는 소형 양방향 토큰 분류 모델이다. 자기회귀 방식으로 사전학습된 체크포인트를 밴디드 어텐션 기반 양방향 분류기로 변환해 한 번의 순전파로 입력 시퀀스에 라벨을 부여한다. 제약된 비터비(Viterbi) 디코더가 8개 프라이버시 범주에 걸쳐 일관된 스팬을 생성하며, 정밀도-재현율 트레이드오프를 조정할 수 있는 설정 가능한 작동점을 제공한다. 총 파라미터 15억 개, 토큰당 활성 파라미터 5000만 개, 컨텍스트 윈도우 12만8000토큰 규모로 로컬 배포와 도메인별 미세조정에 적합하게 설계됐다. 다만 익명화나 컴플라이언스를 보장하는 도구가 아니라, 계층화된 프라이버시 워크플로우 내의 설정 가능한 데이터 최소화 구성요소로 명시된다.
- •OpenAI Privacy Filter: PII·비밀정보 탐지·수정용 소형 양방향 토큰 분류 모델
- •자기회귀 체크포인트를 밴디드 어텐션 양방향 분류기로 변환, 단일 순전파로 처리
- •총 파라미터 15억, 토큰당 활성 파라미터 5000만, 컨텍스트 윈도우 12만8000토큰
- •8개 프라이버시 범주에 걸쳐 정밀도-재현율 트레이드오프 조정 가능
- •익명화·컴플라이언스 보장 도구가 아닌 데이터 최소화 구성요소로 명시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Model Card for OpenAI Privacy Filter
- 1.OpenAI Privacy Filter, PII·비밀정보 탐지·마스킹용 양방향 토큰분류 모델 공개
- 2.오토리그레시브 사전학습 체크포인트를 밴디드어텐션 양방향 분류기로 변환, 단일 순전파 처리
- 3.제약 비터비 디코더로 8개 프라이버시 범주 걸친 일관된 스팬 추출, 정밀도-재현율 조정 가능
- 4.총 15억 파라미터·토큰당 활성 5000만·컨텍스트 12.8만 토큰, 로컬 배포 및 파인튜닝 지원
왜 중요한가?
익명화나 컴플라이언스 보장이 아닌 레이어드 프라이버시 워크플로용 경량 데이터 최소화 구성요소로 설계되었으며, 로컬 배포가 가능한 효율적 구조로 실무 적용성을 높인 점이 특징이다.
언급 프로젝트
개인정보보호법(PIPA)이 엄격하게 적용되는 한국 시장에서, OpenAI의 프라이버시 필터와 같은 PII(개인 식별 정보) 탐지 및 수정 모델은 AI 서비스 개발의 필수 요소입니다. 비정형 텍스트 내 민감 정보를 자동으로 식별하고 비식별화하는 기술은 국내 기업들이 개인정보 규제를 준수하고 AI 윤리를 확보하는 데 큰 도움이 될 것입니다.
본문 미리보기
arXiv:2608.18274v1 Announce Type: new Abstract: OpenAI Privacy Filter is a compact, bidirectional token-classification model for detecting and redacting personally identifiable information (PII) and secrets in unstructured text. The model is derived from an autoregressively pretrained checkpoint and converted into a bidirectional, banded-attention classifier that labels an input sequence in a single forward pass. A constrained Viterbi decoder produces coherent spans across eight privacy categor
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
