인간 능력을 넘어서는 지능을 어떻게 측정할 것인가라는 문제를 다룬 논문이다. 인간이 만든 벤치마크는 포화되고, 인간 능력 이상에서는 출제자가 어떤 과제가 어렵고 검증 가능한지 알기 어렵다는 한계가 절대적 척도 평가에 내재한다고 본다. 저자들은 모델이 서로를 구분하는 공개 챌린지를 스스로 생성하고 그 결과를 집계하는 상대적 측정 패러다임을 제안하며, 이것이 측정 대상 시스템과 함께 확장되는 적대적 심리측정 평점 체계를 낳는다고 주장한다. 사적 정보 공격 유인을 줄이고 심판 없이 판정하며 에이전트 능력에 따라 자연스럽게 확장되는 실용 프로토콜을 제시하고, 검증 가능·개방형 영역 모두에서 이를 구현해 인간 프런티어를 넘어선 측정 가능성을 보였다.
- •인간 제작 벤치마크의 포화와 초인간 수준 평가의 근본 한계를 지적
- •모델이 서로를 구분하는 공개 챌린지를 생성하는 상대적 측정 패러다임 제안
- •사적 정보 공격 유인을 줄이고 심판 없이 판정하는 적대적 심리측정 평점 체계 구축
- •검증 가능·개방형 영역 모두에서 구현해 인간 프런티어를 넘은 측정 가능성 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Measuring Intelligence Beyond Human Scale
- 1.인간 제작 벤치마크 포화 문제에 맞서 모델이 서로를 변별할 과제를 생성하는 상대평가 패러다임 제안
- 2.대결 결과를 집계해 측정 대상과 함께 확장되는 적대적 심리측정 레이팅 시스템 구성
- 3.사적 정보 공격 억제, 심판 없는 판정 등 검증 가능·개방형 영역 모두에 적용하는 프로토콜 제시
왜 중요한가?
모델 능력이 인간 출제자 수준을 넘어서면 절대 척도 평가 자체가 불가능해진다는 구조적 문제에, 상호 대결 기반 상대측정(레이팅)으로 답해 초인적 AI 성능을 지속 측정할 실용적 틀을 제안한다.
본문 미리보기
arXiv:2607.07040v1 Announce Type: new Abstract: How can we measure intelligence beyond human capability? Human-authored benchmarks saturate, and above human capability, examiners may not know which tasks are both hard and verifiable. We argue that this difficulty is inherent to absolute-scale evaluation and propose a new paradigm based on relative measurement in which models generate public challenges that separate other systems. Aggregating these outcomes yields an adversarial psychometric r
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

