이 논문은 LLM 평가에서 여러 신호를 평균으로 집계할 때 평가 신뢰도가 가장 약한 신호의 신뢰도를 크게 초과하는 '신뢰 인플레이션' 현상을 지적하며, 평가 점수를 형식성(인간 평가가 자동 지표보다 강한 증거)·범위(벤치마크 결과는 테스트된 분포에만 적용)·유효기간(오염 누적과 분포 변화로 만료)이라는 세 속성을 가진 인식론적 주장으로 다뤄야 한다고 주장한다. 사고연쇄 분석, 가능성 논리, 대수 이론 등 여러 연구 전통이 수렴적으로 '최약 연결 집계'를 단일 비관 매개변수로 통제되는 매개변수 가족의 보수적 극한으로 확립한다는 점에 근거해, 평가 결과에 형식성 등급·범위 선언·만료일 등의 명시적 메타데이터를 부여할 것을 제안한다. 공개 HELM 리더보드의 54개 프론티어 모델, 10개 시나리오 분석에서 평균 점수와 최약 연결 점수로 선정한 상위 5개 모델이 완전히 일치하지 않음을 보여 평균 집계의 비용을 실증했다.
- •평균 집계가 평가 신뢰도를 가장 약한 신호보다 과대평가하는 '신뢰 인플레이션' 현상 지적
- •평가 점수를 형식성·범위·유효기간 3속성을 가진 인식론적 주장으로 취급할 것을 제안
- •최약 연결 집계가 여러 이론 전통에서 수렴하는 보수적 극한임을 근거로 메타데이터 명시 제안
- •HELM 리더보드 54개 모델 분석에서 평균 vs 최약 연결 기준 상위 5개 모델이 완전히 불일치
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Position: Evaluation Scores Are Perishable Knowledge Claims
본문 미리보기
arXiv:2607.26191v1 Announce Type: new Abstract: Evaluation methodologies for language models increasingly combine multiple signals, from automated metrics and LLM-as-judge ratings to human assessments and benchmark suite results. When these signals are aggregated via averaging, evaluation confidence can then substantially exceed the reliability of the weakest signal: a phenomenon we call trust inflation in evaluation. We argue that evaluation scores should be treated as epistemic claims with th
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:49AI 초안

