AI 벤치마크 업체 Artificial Analysis가 GPT-6 아스트라(Astra) 점수가 실제 성능 향상을 반영하지 못한다는 비판이 제기되자 인텔리전스 인덱스를 v4.2로 개편했다. 기존 지수는 아스트라를 전작과 동급으로 평가했으나, 개편 후에는 전작보다 4점 높은 점수를 받았다. 앤트로픽의 클로드 페이블 5.1이 여전히 1위를 지켰고 아스트라가 2위, 메타가 3위를 차지했다. 아스트라는 다른 프론티어 모델보다 작업당 토큰 사용량이 적은 것으로 나타났다. 개편판은 실무지식 평가용 AA-브리프케이스와 PDF 문서 분석용 GDP.pdf 등 새 벤치마크를 추가하고, 이미 풀린 GPQA-다이아몬드는 제외했으며 비공개 테스트 데이터 비중을 40%로 높여 벤치마크 게이밍을 어렵게 만들었다.
- •Artificial Analysis, GPT-6 아스트라 저평가 논란에 인텔리전스 인덱스 v4.2로 개편
- •개편 후 아스트라 점수가 전작 대비 4점 상승, 클로드 페이블 5.1이 여전히 1위
- •새 벤치마크 AA-브리프케이스·GDP.pdf 추가, 이미 해결된 GPQA-다이아몬드는 제외
- •비공개 테스트 데이터 비중을 40%로 높여 벤치마크 게임방지
- •아스트라, 다른 프론티어 모델보다 작업당 토큰 사용량 적어
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Artificial Analysis overhauls its Intelligence Index after GPT-6 Astra scoring drew skepticism

- 1.Artificial Analysis, 점수 논란 후 Intelligence Index v4.2 공개…Astra는 전작보다 4점만 상승
- 2.새 지수 순위는 Claude Fable 5.1, GPT-6 Astra, Meta 순…Astra는 토큰 소모량이 프론티어 중 최소
- 3.AA-Briefcase(실무지식), GDP.pdf(PDF 문서분석) 벤치마크 신규 추가, 포화된 GPQA-Diamond는 제외
- 4.비공개 테스트 데이터 비중을 40%로 늘려 벤치마크 게이밍 방지를 강화, 대규모 개편판 v5는 8개월째 준비 중
왜 중요한가?
Epoch AI 등 다른 평가에서 GPT-6 Astra를 압도적 1위로 평가한 것과 달리 Artificial Analysis는 소폭 개선만 인정하면서 벤치마크 신뢰성 논쟁이 표면화됐고, 이는 프론티어 모델 간 실제 성능 격차를 어떤 잣대로 판단해야 하는지에 대한 업계 논쟁을 보여준다.
본문 미리보기
Artificial Analysis has released version 4.2 of its Intelligence Index, likely in response to criticism that its benchmarks failed to capture GPT-6 Astra's actual progress. Astra now scores four points above its predecessor but still trails Anthropic's Claude Fable 5.1. The article Artificial Analysis overhauls its Intelligence Index after GPT-6 Astra scoring drew skepticism appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
