AI 연구기관 에포크 AI가 18일 주요 AI 성능 벤치마크 자체의 신뢰성을 감사하는 '벤치마크 리뷰' 프로젝트를 시작한다고 발표했다. 15개 주요 벤치마크를 검토한 초기 결과 4개만 '검증(Verified)' 판정을 받았고 9개는 '결함(Flawed)', 2개는 '정보 부족'으로 분류됐다. 검토 대상에는 '인류의 마지막 시험(HLE)', SWE-벤치 베리파이드, 버클리 함수 호출 리더보드 등 업계에서 널리 쓰이는 평가가 포함됐으며, 잘못된 정답이나 오류가 있는 채점 방식, 버전 변화에 따른 기준 불일치 등이 구체적으로 지적됐다. 조사 대상 문제의 20% 이상에서 점수에 영향을 미치는 오류가 발견되면 결함 판정을 내리는 방식으로, 에포크 AI는 모델 점수뿐 아니라 시험지 자체의 신뢰성부터 따져봐야 한다고 강조했다.
- •에포크 AI, AI 벤치마크 자체를 감사·검증하는 '벤치마크 리붰' 프로젝트 개시
- •15개 벤치마크 중 4개 '검증', 9개 '결함', 2개 '정보부족' 판정
- •HLE, SWE-벤치 베리파이드, 버클리 함수 호출 리더보드 등 주요 벤치마크도 결함 지적 대상에 포함
- •잘못된 정답, 오류 있는 채점 방식, 버전 간 기준 불일치 등이 주요 결함 사례
- •조사 문제의 20% 이상에서 점수 영향 오류 발견 시 '결함' 판정하는 기준 적용
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
에포크 AI, 벤치마크 검증 착수..."15개 중 9개 결함"
- 1.에포크 AI, 주요 AI 벤치마크 신뢰성을 감사하는 '벤치마크 리뷰' 착수, 15개 중 9개서 결함 발견해 '결함' 판정
- 2.HLE·SWE-벤치 베리파이드·버클리 함수 호출 리더보드 등 업계 표준 벤치마크도 검토 대상에 포함돼 오류 확인
- 3.버클리 함수 호출 리더보드는 도구 사용이 정답인 문제에 도구 거부 답변에 점수를 주는 채점 오류가 실제 발견됨
- 4.검증 통과 기준은 문제 20% 이상 오류 시 결함 판정, 심플QA 베리파이드 등 4개만 치명적 결함 없이 통과
왜 중요한가?
AI 모델 순위표와 성능 비교의 신뢰도가 벤치마크 자체의 품질에 좌우되는데, 이번 감사가 널리 쓰이는 시험지에서도 채점 오류와 버전 간 불일치가 존재함을 실증했다는 점에서 리더보드 맹신에 경종을 울리는 첫 체계적 사례다.
언급 프로젝트
본문 미리보기
AI 모델의 성능을 비교하는 기준으로 쓰이는 ‘벤치마크’ 자체의 신뢰성을 먼저 따져봐야 한다는 지적이 나왔다. AI 모델의 점수를 넘어 평가 시험지 자체를 감사하고 검증하는 첫 사례가 나온 것이다.AI 연구기관 에포크 AI는 18일(현지시간) 주요 벤치마크의 문제점과 한계를 체계적으로 점검하는 ‘벤치마크 리뷰(Benchmark Reviews)’를 시작한다고 발표하며 "벤치마크 문제점을 체계적으로 점검하겠다"고 밝혔다.에포크 AI가 공개한 초기 검토 결과에 따르면 15개 벤치마크 가운데 4개는 ‘검증(Verified)’, 9개는 ‘결
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

