오픈AI의 신모델 GPT-6 아스트라를 둘러싸고 벤치마크 평가가 엇갈리고 있다. 이포크AI(Epoch AI)는 169점으로 아스트라를 1위로 평가했지만, 아티피셜 애널리시스는 이전 모델과 별 차이가 없고 클로드 페이블 5.1보다도 낮다고 평가했다. 가장 주목할 결과는 ARC-AGI-3 벤치마크로, 아스트라가 처음으로 평균적인 인간보다 효율적으로 문제를 해결한 것으로 나타났다. ARC 프라이즈의 프랑수아 숄레는 이를 AGI의 증거로 보지는 않지만, 예상보다 2배 빠른 속도로 발전이 이뤄지고 있다며 AGI 도달 시점 전망을 앞당겼다.
- •이포크AI는 아스트라에 169점을 매겨 최상위로 평가, 아티피셜 애널리시스는 이전 모델과 비슷하거나 클로드 페이블 5.1보다 낮다고 평가
- •ARC-AGI-3에서 아스트라가 처음으로 평균 인간보다 효율적인 문제 해결력을 보임
- •프랑수아 숄레는 AGI 증거는 아니라면서도 예상보다 2배 빠른 진전 속도를 언급하며 AGI 전망 시점을 앞당김
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Benchmarks disagree on GPT-6 Astra, but its human-beating efficiency on ARC-AGI-3 pulls Chollet’s AGI forecast forward

- 1.Epoch AI, GPT-6 Astra에 169점 매겨 벤치마크 1위 평가
- 2.Artificial Analysis는 전작과 동급, Fable 5.1보다 낮다 평가
- 3.ARC-AGI-3서 Astra, 처음으로 평균 인간보다 효율적으로 과제 수행
- 4.ARC Prize 숄레, 결과 근거로 AGI 도달 시점 전망 앞당김
왜 중요한가?
벤치마크 기관마다 평가가 엇갈렸음에도, AGI 논의의 핵심 척도인 ARC-AGI-3에서 인간 평균 효율을 넘어선 첫 사례라는 점에서 AGI 도달 시점 논쟁에 구체적 근거를 더한다.
본문 미리보기
OpenAI's GPT-6 Astra is drawing contradictory benchmark verdicts. Epoch AI puts it out in front with 169 points, while Artificial Analysis rates it no better than its predecessor and behind Claude Fable 5.1. The biggest surprise comes from ARC-AGI-3, where Astra works more efficiently than the average human for the first time. ARC Prize chief François Chollet doesn't call this proof of AGI, but he does see the progress running "twice as fast" as he expected, and he's moving up his AGI forecast.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
