이 연구는 레이블링 행동만으로 어노테이터의 내부 안전 정책을 학습하는 해석 가능한 모델인 어노테이터 정책 모델(APM)을 제안합니다. APM은 추가 주석 부담 없이 어노테이터 추론을 가시화하고 비교 가능하게 하며, 80% 이상의 정확도와 반사실적 편집에 대한 높은 충실도를 달성했습니다. 안전 지침 해석 차이로 인한 정책 모호성 파악과 인구통계 집단 간 안전 우선순위 차이(가치 다원주의) 발견에 활용되어 보다 투명하고 포용적인 안전 정책 설계를 지원합니다.
- •레이블링 행동만으로 어노테이터 내부 안전 정책을 학습하는 APM 제안, 추가 주석 불필요
- •80% 이상 정확도로 안전 정책 모델링, 반사실적 편집에도 충실하게 예측함을 검증
- •안전 지침 해석 차이로 인한 정책 모호성과 인구통계 집단 간 안전 우선순위 차이 발견에 활용
- •보다 표적화되고 투명하며 포용적인 안전 정책 설계를 위한 도구로 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Understanding Annotator Safety Policy with Interpretability
- 1.주석자 레이블링 행동만으로 내부 안전 정책을 학습하는 APM(주석자 정책 모델) 도입
- 2.APM은 80% 이상 정확도로 안전 정책 모델링하며 반사실적 편집에 대한 웅답도 충실히 예측
- 3.LLM·인간 주석에서 정책 모호성 및 인구통계 그룹 간 안전 우선순위 차이 등 가치 다원성 식별
왜 중요한가?
추가 주석 비용 없이 주석자의 안전 정책 해석 차이를 가시화하여 더 포용적이고 투명한 AI 안전 정책 설계를 지원하는 실용적 도구를 제공한다.
본문 미리보기
arXiv:2605.05329v1 Announce Type: new Abstract: Safety policies define what constitutes safe and unsafe AI outputs, guiding data annotation and model development. However, annotation disagreement is pervasive and can stem from multiple sources such as operational failures (annotators misunderstand or misexecute the task), policy ambiguity (policy wording leaves room for interpretation), or value pluralism (different annotators hold different perspectives on safety). Distinguishing these sources
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

