장애 당사자들과 공동 개발한 DisaBench는 기존 범용 안전 벤치마크가 언어 모델의 장애 관련 피해를 적절히 평가하지 못한다는 문제를 해결합니다. 12개 장애 피해 범주 분류체계와 7개 생활 영역에 걸친 175개 프롬프트 및 525개 응답 쌍 데이터셋을 제공합니다. 장애 당사자 4명의 평가 결과, 피해율은 장애 유형별로 크게 다르며 일반 안전 평가는 미묘한 피해를 놓침을 발견했습니다. 데이터셋과 오픈소스 레드팀 프레임워크는 Hugging Face에서 공개 예정입니다.
- •DisaBench는 언어 모델의 장애 관련 피해를 전문적으로 평가하는 참여형 프레임워크
- •장애 당사자와 공동 개발한 12개 피해 범주와 7개 생활 영역 포괄
- •일반 안전 평가는 명백한 실패만 감지하고 미묘한 장애 관련 피해를 놓침을 입증
- •오픈소스 레드팀 프레임워크로 기존 안전 파이프라인에 직접 통합 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DisaBench: A Participatory Evaluation Framework for Disability Harms in Language Models
- 1.장애인과 협력해 12개 장애 관련 피해 범주 분류체계를 개발한 DisaBench 평가 프레임워크 제안
- 2.7개 생활 영역에서 175개 프롬프트, 525개 응답 쌍을 장애 경험자가 직접 어노테이션
- 3.장애 유형별 피해율 차이가 크며, 일반 안전 평가는 미묘한 피해를 놓침
- 4.Hugging Face 및 오픈소스 레드팀 프레임워크로 공개 예정
왜 중요한가?
기존 LLM 안전 벤치마크가 장애인 관련 피해를 체계적으로 평가하지 못하는 공백을 채우며, 문화적·교차적 맥락을 반영한 포용적 AI 안전 평가 표준을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2605.12702v1 Announce Type: new Abstract: General-purpose safety benchmarks for large language models do not adequately evaluate disability-related harms. We introduce DisaBench: a taxonomy of twelve disability harm categories co-created with people with disabilities and red teaming experts, a taxonomy-driven evaluation methodology that pairs benign and adversarial prompts across seven life domains, and a dataset of 175 prompts with human-annotated labels on 525 prompt-response pairs. Ann
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

