Every Eval Ever(EEE)와 Hugging Face Community Evals가 상호 호환되어, 평가 결과를 한 번 제출하면 HF 모델 페이지와 벤치마크 리더보드에 표시되면서 전체 EEE 기록으로 역추적할 수 있게 됐다. EEE 데이터스토어는 2026년 2월 출시 후 22,000여 개 모델과 2,200여 개 벤치마크에 걸쳐 약 229,000건의 평가 결과를 31개 리포팅 포맷에서 수집했다. 새 컨버터는 EEE 레코드를 HF가 요구하는 .eval_results YAML로 자동 변환하며 현재 MMLU-Pro·GPQA·HLE·GSM8K를 지원하고, 기존 점수와의 충돌을 감사한 뒤 명시적 승인이 있어야 PR을 연다. 같은 모델·벤치마크에서도 실행 주체에 따라 점수가 크게 갈리는(LLaMA 65B MMLU 63.7 vs 48.8) 재현성 문제를 완화하려는 표준화 시도로, 평가 결과를 읽고 쓰는 모든 이에게 유용하다.
- •EEE 데이터스토어는 약 229,000건 평가 결과·22,000+ 모델·2,200+ 벤치마크를 31개 리포팅 포맷에서 통합, 재현 비용은 수십만 달러 규모
- •컨버터가 EEE 레코드를 HF .eval_results YAML로 자동 변환, 현재 MMLU-Pro·GPQA·HLE·GSM8K 4개 공식 벤치마크 지원
- •모든 점수에 author/community/verified 출처 배지가 붙고 생성 설정·하네스 버전이 담긴 EEE 전체 JSON 기록으로 링크
- •조직 공식 HF 계정으로 제출하면 EvalEval에 verified 체크마크 표시
- •미보고 평가 설정 탓에 LLaMA 65B의 MMLU 점수가 63.7과 48.8로 갈리는 등 재현성 격차가 이 표준화의 배경
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Featuring Every Eval Ever Results on Hugging Face Model Pages

- 1.Every Eval Ever(EEE)와 Hugging Face Community Evals가 상호호환되어 평가 결과 교차게시·해석 지원
- 2.EEE는 실행자·모델·접근방식·생성설정·지표의미를 기록하는 단일 JSON 스키마로 31개 포맷 통합
- 3.데이터스토어는 2.2만개 모델·2200개 벤치마크에 걸쳐 약 22.9만개 평가 결과 보유
- 4.동일 모델·벤치마크도 실행자마다 점수가 달라(LLaMA 65B MMLU 63.7 vs 48.8) 재현성 문제 해결 지향
왜 중요한가?
평가 결과가 논문·리더보드·블로그에 흩어져 형식이 제각각이라 신뢰·비교가 어렵던 문제를, 단일 스키마와 소스 배지 역추적으로 표준화했다. 재현에 수십만 달러가 드는 평가 데이터를 흩어지지 않게 모아 연구자·정책결정자의 모델 선택 근거를 강화한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 23:17AI 초안

