이 논문은 AI 벤치마크 결과가 하나의 결론적 주장에 도달하기까지 일반화, 역량 증거로의 해석, 새로운 과제로의 외삽, 다른 시스템·현장으로의 전이 등 여러 단계를 거친다는 점에 주목해 '투사가능성(projectibility)' 문제를 제기한다. 각 단계에서의 연결(warrant)이 정당하더라도 전체 추론 사슬이 정당화되지는 않는다는 점을 지적하며, 유형화된 출처·대상 기술과 서로 만나지 않는 끝점과 만나지만 근거가 전달되지 않는 끝점을 구분하는 '인터페이스 감사' 절차를 제안한다. 법률 연구 사례를 통해 벤치마크 증거와 배포 연구가 각각은 타당하지만 서로 평행선을 이루는 상황을 보여주고, 알려진 정답 사례를 통해 집계 안정성이 이후 투사에 필요한 구분을 지워버릴 수 있음을 증명한다. 이는 벤치마크-실사용 간 근거 없는 연결을 진단하는 틀을 제공한다.
- •AI 벤치마크 결과가 실사용 주장으로 이어지는 추론 사슬의 '투사가능성(projectibility)' 문제 제기
- •유형화된 출처·대상 기술로 '만나지 않는 끝점'과 '만나지만 근거가 끊긴 끝점'을 구분하는 인터페이스 감사 절차 제안
- •법률 연구 사례로 벤치마크 증거와 배포 연구가 각각 타당해도 평행선을 이루는 상황 입증
- •집계 안정성이 이후 투사에 필요한 구분을 지울 수 있음을 실증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When benchmark inferences do not compose: Projectibility in AI evaluation
본문 미리보기
arXiv:2607.26159v1 Announce Type: new Abstract: An AI benchmark result rarely reaches a consequential claim in one step. Evaluators generalize it to further cases, interpret it as evidence of capability, extrapolate it to new tasks, transport it to another system or site, and combine it with assumptions about human review and downstream consequences. Validity-centred approaches require evidence for each claim. This paper identifies a further epistemic problem: warranted links don't automaticall
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:49AI 초안

