Hugging Face와 alphaXiv가 주최한 해커톤에서 1,221명의 참가자가 자체 코딩 에이전트로 ICML 2026 발표 논문의 claim을 하나하나 재현하는 대규모 검증을 진행했다. 19일간 6,816건의 재현 로그북이 게시돼 전체 논문의 34%에 해당하는 2,226편, 3만 5,908개 주장이 채점됐고, 검토 대상 논문의 51%(1,103편)는 최소 하나의 주장이 검증됐으며 이 중 266편은 모든 주장이 완전히 재현됐다. 반대로 23%(496편)는 하나 이상의 주장이 반증되거나 이의가 제기됐고, 49편은 모든 주장이 반증됐으며 242편은 서로 다른 재현팀이 같은 주장에 대해 상반된 결론을 냈다. "Towards Optimal Robustness in Learning-Augmented Paging"의 강건성 증명 오류처럼 자동화된 심판과 사람의 재검증을 거친 확인된 반증 사례도 다수 소개됐다. 이는 AI 에이전트가 연구 재현을 대규모로 수행할 수 있게 됐지만, 국소 루프에 갇히는 등의 한계로 인해 사람의 방향 제시와 판단이 여전히 중요하다는 점을 보여준다.
- •1,221명이 참여해 6,816건의 재현 로그북으로 ICML 2026 논문 2,226편(34%), 주장 35,908건을 검증
- •검토 논문의 51%(1,103편)가 최소 하나 이상 검증됨, 266편은 모든 주장이 완전 재현
- •23%(496편)는 주장 반증·이의 제기, 242편은 재현팀 간 상반된 결론이 나옴
- •강건성 증명 오류, KL 발산 불일치 등 확인된 반증 사례 다수, 저자들이 arXiv 정정 진행 중
- •AI 에이전트가 국소 루프에 갇히는 등 한계로 인해 인간의 방향 제시·판단이 여전히 중요
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
What We Learned by Reproducing 2,200 papers from ICML
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

