이 논문은 AI가 기존 지식을 학습·적용하는 수준을 넘어 미지의 영역을 탐색하고 새로운 지식을 창출할 수 있는지 평가하는 최초의 벤치마크 ASI-Bench를 소개한다. 40여 명의 전문가가 3만 1,000시간 이상을 투입해 11개 과학 분야에 걸친 60개 프로젝트 단위 연구 과제를 구축했으며, 동일 연구 프로젝트 내에서 인간의 방법론적 지침을 단계적으로 줄여가며 AI가 스스로 어디까지 나아갈 수 있는지를 시험한다. 18개 최신 에이전트·모델 조합을 평가한 결과, 평균 점수는 방법론을 완전히 안내받았을 때 50.91점에서 방법만 지정됐을 때 29.10점, AI가 스스로 방법을 정해야 할 때 26.62점으로 급락했다. 이는 현재 AI 시스템이 여전히 인간의 안내에 크게 의존하며, 프로젝트 단위의 자율적 종단 간 과학 연구와는 거리가 멀다는 점을 보여준다.
- •AI의 혁신적 탐색과 자율적 과학 실행 능력을 함께 평가하는 최초의 벤치마크 ASI-Bench를 40여 명 전문가가 3만 1,000시간을 들여 구축했다.
- •11개 과학 분야 60개 프로젝트 단위 과제에서 인간의 방법론적 지침을 단계적으로 줄여가며 AI의 자율성을 시험한다.
- •18개 최신 에이전트·모델 조합의 평균 점수가 완전 지침 제공 시 50.91점에서 자율 방법 결정 시 26.62점으로 급락했다.
- •결과는 현재 AI가 여전히 인간 안내에 크게 의존하며 자율적 종단 간 연구 수행과는 거리가 멘 상태임을 보여준다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ASI-Bench: At the Dawn of Artificial Superintelligence
- 1.ASI-Bench 공개, AI의 혁신적 탐구·자율 과학 수행 능력을 평가하는 최초 벤치마크
- 2.전문가 40명 이상, 3만1천 시간 투입해 11개 분야 60개 프로젝트 단위 과제 구성
- 3.인간 가이드를 점진적으로 철회하며 AI가 스스로 방법을 선택하는지 시험
- 4.18개 최신 에이전트-모델 조합에서 평균 점수 50.91→26.62로 급감, 인간 의존도 확인
왜 중요한가?
기존 벤치마크가 학습된 지식 기반 정답 산출을 주로 평가했다면, ASI-Bench는 방법론적 가이드를 단계적으로 제거해 AI의 자율 연구 수행 능력을 직접 측정함으로써 현재 시스템이 인간 가이드에 얼마나 의존하는지를 정량적으로 드러낸다.
언급 프로젝트
본문 미리보기
arXiv:2608.17271v1 Announce Type: new Abstract: Artificial superintelligence (ASI) requires AI to move beyond mastering existing knowledge toward exploring the unknown, creating new knowledge, and turning new ideas into verifiable results. However, the capabilities of today's AI systems are still largely built on learning, compressing, and applying existing human knowledge. Accordingly, existing benchmarks primarily test whether AI can produce correct answers based on learned knowledge, or whet
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
