DiG-bench는 목표가 알려지지 않은 통제 환경에서 새로운 지식을 실험을 통해 발견하는 AI의 능력을 직접 측정하는 벤치마크로, 기존 벤치마크가 다루지 못한 '발견' 역량의 공백을 메운다. 짧은 문자열로 인코딩된 70개의 독립적인 게임으로 구성되며, 각 게임은 상호작용과 실험을 통해서만 알아낼 수 있는 고유한 변환 규칙을 갖고 승리 조건조차 미지수다. 난이도는 7단계로 나뉘어 최하위 단계는 여러 모델이 쉽게 풀지만 최상위 단계는 최고 성능 에이전트 하네스에도 도전적이며, 70개 게임 모두 사람은 첫 시도에 풀어냈다. 21개 게임은 공개되고 나머지는 안전한 평가를 위해 비공개로 유지된다.
- •목표가 미지인 환경에서의 과학적 발견 능력을 측정하는 첫 벤치마크중 하나
- •70개 독립 게임, 각각 고유한 변환 규칙을 실험으로 발견해야 함
- •7단계 난이도로 모델 능력 별 도전 과제 제공
- •모든 게임을 사람은 첫 시도에 해결
- •21개 공개, 나머지는 보안 평가를 위해 비공개 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DiG-bench: Discovery in Games
- 1.미지의 규칙을 실험으로 발견해야 하는 AI 벤치마크 DiG-bench 공개, 70개의 독립적 게임으로 구성
- 2.각 게임은 고유한 변환 규칙을 가지며 난이도 7단계, 최상위 티어는 최고 성능 에이전트도 어려워함
- 3.70개 게임 모두 최소 한 명 이상의 인간이 첫 시도에서 해결, 21개는 공개하고 나머지는 비공개 평가용으로 보존
왜 중요한가?
기존 AI 벤치마크는 목표가 알려진 문제 해결 능력을 주로 측정했지만, DiG-bench는 목표조차 모른 채 실험을 통해 새 규칙을 발견하는 과학적 발견 역량을 직접 테스트해 모델의 탐구·일반화 능력을 가늠할 새 척도를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2608.12593v1 Announce Type: new Abstract: Discovery---formulating novel generalizations---is a central part of the scientific process. Despite its importance, there is a gap in the current AI benchmark landscape, with few benchmarks directly probing the capacity for discovering new knowledge with experimentation in controlled environments where the objective is unknown. To address this gap, we release a new benchmark: DiG-bench (Discovery in Games). DiG-bench consists of a set of 70 indep
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

