텍스트 분류기(지도학습 모델·LLM)의 성능 지표인 재현율·정밀도가 표본 변동에 노출된 점 추정치인데도 불확실성 보고가 일관되지 않고, 보고되더라도 소규모 데이터나 고성능 상황에 부적절한 방법이 쓰인다는 문제를 다룬 연구다. 사회과학 텍스트 분류의 전형적 조건(중소 표본, 드문 구성개념, 개인 내 중첩 텍스트)에서 신뢰구간 방법들을 시뮬레이션으로 평가한 결과, 기본값인 Wald 구간과 퍼센타일 부트스트랩은 커버리지가 명목 95%에 크게 못 미쳤다. Agresti-Coull, Wilson, Clopper-Pearson과 F1 계산에 유용한 새 의사 카운트 정규화 부트스트랩이 더 정확했고, 중첩 데이터에서는 유효 N과 자유도 보정이 필수였다. 검증 표본 크기를 설계 단계부터 고려하라는 실무 지침을 제공한다.
- •분류기 성능 지표의 신뢰구간 보고 관행이 부재하거나 부적절하다는 문제 제기
- •Wald 구간·기본 부트스트랩은 커버리지가 95%에 크게 미달
- •Agresti-Coull·Wilson·Clopper-Pearson과 새 의사 카운트 정규화 부트스트랩(F1용)이 우수
- •개인 내 중첩 텍스트에서는 유효 N과 자유도 보정이 필수
- •계층적 부트스트랩은 개인당 텍스트가 적으면 과도하게 보수적
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data
- 1.Wald·기본 백분위 부트스트랩 신뢰구간은 95% 명목수준에 크게 못 미쳐 가장 부정확
- 2.Agresti-Coull·Wilson·Clopper-Pearson과 신규 의사카운트 정규화 부트스트랩이 정확도 개선
- 3.텍스트가 개인 내 중첩된 경우 유효 N과 자유도 조정이 필요함을 입증
- 4.계층적 부트스트랩은 개인당 텍스트가 중간 수일 때 군집 부트스트랩보다 정확
왜 중요한가?
소표본·고성능·중첩 데이터에서 흔히 쓰는 기본 신뢰구간이 실제 불확실성을 과소평가함을 보여, 사회과학 텍스트분류 ML 측정의 타당성과 재현성 보고 관행에 직접적 지침을 제공한다.
본문 미리보기
arXiv:2606.26422v1 Announce Type: new Abstract: Researchers increasingly use text classification--supervised models or large language models--to measure constructs from natural language, providing metrics such as recall and precision as evidence of their validity. Yet, though these metrics are point estimates subject to sampling variation, measures of uncertainty are inconsistently reported alongside them. Further, when they are reported, they are often estimated with methods that are not appro
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

