LLM 에이전트의 프라이버시-유용성 트레이드오프를 평가하는 POLAR-Bench를 소개한다. 10개 도메인, 7,852개 샘플에서 프라이버시 정책을 가진 신뢰 모델이 적대적 제3자와 상호작용하는 시나리오를 구성했다. 프론티어 모델은 보호 속성의 99% 이상을 보호한 반면, 온디바이스나 프라이빗 추론에 사용되는 1~30B 규모의 소형 오픈웨이트 모델은 절반 이상을 유출하는 것으로 나타났다. POLAR-Bench는 프라이버시 정렬이 가장 필요한 소형 모델의 의도 추종 취약점을 구체적으로 진단한다.
- •LLM 에이전트의 프라이버시-유용성 트레이드오프를 체계적으로 진단하는 POLAR-Bench 제안
- •적대적 제3자가 프라이버시 정책을 우회하도록 유도하는 10개 도메인 7,852개 샘플 구성
- •프론티어 모델은 보호 속성 99% 이상 보호, 1~30B 소형 오픈웨이트 모델은 절반 이상 유출
- •온디바이스·프라이빗 추론용 소형 모델에서 프라이버시 정렬 취약점이 집중적으로 발견됨
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents
- 1.LLM 에이전트의 프라이버시-유용성 트레이드오프를 진단하는 POLAR-Bench 소개
- 2.10개 도메인, 7,852개 샘플로 적대적 서드파티가 주요 속성 탐색하는 시나리오 평가
- 3.프론티어 모델은 보호 속성 99% 이상 삭제, 1~30B 소형 오픈소스 모델은 절반 이상 누출
왜 중요한가?
온디바이스·프라이빗 추론에 사용되는 소형 모델들이 프라이버시 보호에 취약하다는 점을 실증하여 에이전트 프라이버시 정렬 연구의 시급성을 부각한다.
언급 프로젝트
본문 미리보기
arXiv:2605.19127v1 Announce Type: new Abstract: LLM agents increasingly have access to private user data and act on the user's behalf when interacting with third-party systems. The user defines what may and must not be shared, and the agent must robustly follow that intent even when third-party systems behave adversarially. We introduce POLAR-Bench (Policy-aware adversarial Benchmark), in which a trusted model with a privacy policy and a task converses with a third-party model that adversariall
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

