이 논문은 옵션 순서, 프롬프트 문구, 답변 판정 방식(생성 텍스트 vs 확률) 등 평가 하네스 설정이 LLM 벤치마크 순위를 좌우한다는 점을 대규모로 입증했다. ARC, HellaSwag, MMLU, TruthfulQA 등 4개 벤치마크의 3679개 문항에 대해 12개 오픈웨이트 모델을 26가지 하네스 설정으로 평가한 '취약성 그리드(fragility grid)'를 구축한 결과, gemma4-31b의 점수는 하네스에 따라 31%에서 89%까지 벌어졌다. 인접 모델 간 격차의 95.7%가 설정에 취약한 소수 문항에서 발생했으며, 12개 모델 중 4개가 설정에 따라 1위를 차지할 수 있어 사실상 하네스가 승자를 결정하는 셈이었다. 벤치마크 압축 기법이 오히려 이런 취약 문항을 걸러내지 못하고 남겨둔다는 점도 확인됐다.
- •동일 문항·모델이라도 하네스 설정(옵션순서·판정방식)에 따라 점수 최대 58%p 차이
- •12개 모델 중 4개가 설정에 따라 1위 차지 가능…하네스가 순위 결정
- •모델 간 격차의 95.7%가 소수의 '설정 취약' 문항에서 발생
- •벤치마크 압축 기법이 취약 문항을 제거하지 못하고 오히려 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items
- 1.ARC·HellaSwag·MMLU·TruthfulQA 3679문항을 26가지 평가 하네스로 재측정하는 'fragility grid' 도입
- 2.gemma4-31b는 하네스 설정만으로 31~89%까지 요동, 점수가 '점'이 아닌 '구간'임을 실증
- 3.인접 모델 간 순위 격차의 95.7%가 하네스 취약 문항에서 발생, 12개 모델 중 4개가 특정설정서 1위
- 4.벤치마크 압축기법이 최적화하는 문항 판별력이 하네스 취약성과 상관 0.28로 취약 문항을 오히려 남김
왜 중요한가?
동일한 문항·정답·모델 가중치라도 옵션 순서가 아닌 '채점 방식'이 리더보드 순위를 좌우한다는 것을 정량적으로 밝혀, LLM 벤치마크 순위를 그대로 신뢰하기 어렵다는 근본적 문제를 제기한다.
본문 미리보기
arXiv:2608.21382v1 Announce Type: new Abstract: Multiple-choice benchmarks fix the questions and the correct answers, but not the harness: the order of the options, the wording of the prompt, and whether a language model's answer is read from generated text or from per-option likelihoods. Work on this harness sensitivity reports it as aggregate score variance, leaving unexamined which items the variance falls on and whether they are the items that separate one model from the next. We treat the
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
