고위험 자동화 의사결정에서 불확실성 증강(UA) 시스템을 종합적으로 평가하기 위한 ECUAS_n 메트릭 패밀리를 제안한다. 기존 평가 방식이 예측과 불확실성 점수를 분리하거나 고정된 기각 비용을 사용해 부적합함을 지적한다. ECUAS_n은 올바른 스코어링 규칙으로 정식화되어 예측 정확도와 불확실성 품질을 통합 평가한다. 파라미터 n으로 잘못된 예측 비용과 불완전한 불확실성 비용 간의 균형을 사용 사례에 맞게 조절할 수 있다.
- •ECUAS_n은 파라미터 n으로 사용 사례별 비용 균형을 조절하는 취소 가능한 평가 메트릭 패밀리다.
- •기존 평가방식(분리 메트릭 또는 고정 기각 비용)이 고위험 의사결정에 부적합함을 이론적·실험적으로 담당한다.
- •다양한 분류 및 생성 데이터셋(TriviaQA 포함)에서 ECUAS_n의 장점을 실험적으로 검증했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
$ECUAS_n$: A family of metrics for principled evaluation of uncertainty-augmented systems
- 1.고위험 자동화 의사결정에서 예측과 불확실성 점수를 통합 평가하는 ECUAS_n 지표 패밀리 제안
- 2.기존 평가 방식(별도 지표, 고정 거부 비용, 커버리지-리스크 곡선)의 한계를 편향 없는 스코어링 규칙으로 극복
- 3.파라미터 n으로 유스케이스별 오류 비용과 불완전한 불확실성 간 트레이드오프 제어 가능
왜 중요한가?
불확실성 예측을 포함한 AI 시스템의 의사결정 성능을 원칙적으로 평가하는 새로운 척도를 제공해 고위험 AI 배포에 실용적 가치가 있다.
본문 미리보기
arXiv:2605.20490v2 Announce Type: new Abstract: In high-stakes automated decision-making, access to predictive uncertainty is essential for enabling users -- human or downstream systems -- to accept or reject predictions based on application-specific cost trade-offs. Such uncertainty-augmented (UA) systems -- i.e., systems that output both predictions and uncertainty scores -- are currently being assessed in the literature in a variety of ways, using separate metrics to evaluate the predictions
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

