사이먼 윌리슨은 자신의 블로그에서 오픈AI GPT-6 Astra의 성능을 분석했다. Astra는 ChatGPT Plus·Pro·비즈니스·엔터프라이즈 사용자와 API·AWS를 통해 순차 공개되며, API 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러로 클로드 Fable 5와 동일하다. ARC-AGI 3 벤치마크에서 99.9%를 기록했지만 이는 특수한 'Provider Adapter' 하네스를 사용한 결과이며 기본 하네스에서는 62.7%에 그쳤다. 사이버보안 관련 ExploitBench(100%)와 긴 문맥 처리(100만 토큰 구간 96.3%)에서 강세를 보였지만, Artificial Analysis의 종합 지능 지수에서는 Fable 5.1과 메타 Muse Spark에 여전히 뒤처진다고 평가했다.
- •API 가격은 입력 100만 토큰당 10달러·출력 50달러로 클로드 Fable 5와 동일
- •ARC-AGI 3 벤치마크 99.9%는 특수 하니스 사용 결과, 기본 하니스는 62.7%에 그침
- •사이버보안 ExploitBench 100%, SRE-Bench 리버스엔지니어링 99.2% 등 보안 특화 강세
- •긴 문맥 처리에서 100만 토큰 구간 96.3% 기록해 기존 한계 극복 시사
- •종합 지능 지수는 61로 Fable 5.1(+5점), 메타 Muse Spark에는 여전히 뒤처짐
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GPT‑6 Astra
- 1.오픈AI, GPT-6 아스트라 출시…API 가격 입력 100만토큰당 10달러, 출력 50달러로 클로드 Fable5와 동일
- 2.ARC-AGI 3 벤치마크 99.9% 달성(전용 'Provider Adapter harness' 사용, 기본 하네스는 62.7%)
- 3.ExploitBench 100%, SRE-Bench 이진 리버스엔지니어링 99.2%로 보안 과제서 GPT-5.6 Sol 압도
- 4.Artificial Analysis 지능지수는 61점으로 Fable 5.1(max)보다 5점 낮고 메타 Muse Spark 1.3에도 뒤처져
왜 중요한가?
보안·장문맥락 과제에서 압도적 성능과 코딩 에이전트 비용효율을 앞세운 반면 범용 지능지수는 경쟁 모델에 못 미쳐, 모델 선택이 단일 지표가 아닌 과제별 특화 성능으로 세분화되는 흐름을 보여준다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:46AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
