Anthropic의 Claude Opus 5가 신규 과제 해결 능력을 재는 ARC-AGI-3 벤치마크에서 30.2%를 기록, OpenAI GPT-5.6 Sol(Max)의 종전 최고 7.8%를 약 4배 앞섰다. 미해결 환경 5개를 새로 풀었고 이 중 4개는 인간 수준 이상이었으며, 과제를 대수 표기로 변환하고 반사 방정식을 스스로 세우는 등 이전 모델에서 없던 행동을 보였다. ARC Prize는 이를 자율적 탐색·계획을 가능케 하는 논리 추론 향상 덕분으로 분석했다. 다만 사설 벤치마크 Witness에서는 43.4점으로 Kimi K3·Fable 5와 통계적 동률에 그쳐, ARC-AGI-3 공개 이후 개발된 모델인 만큼 벤치마크 타깃 학습 가능성도 제기된다. 추론 성능 도약이 실제로 얼마나 일반화되는지가 향후 검증 관건이다.
- •Claude Opus 5, ARC-AGI-3에서 30.2% 기록—GPT-5.6 Sol(Max)의 종전 기록 7.8%의 약 4배
- •미해결 환경 5개 해결(4개는 인간 수준 이상), 과제의 대수 표기 변환·반사 방정식 독자 수립 등 신규 행동 관찰
- •ARC-AGI-2 90.4%, ARC-AGI-1 97.5%로 기존 최고 수준과 동률(비용은 다소 높음)
- •사설 벤치마크 Witness에서는 43.4점으로 Kimi K3·Fable 5와 통계적 동률—향상 폭이 훨씬 작아 벤치마크 타깃 학습 논쟁
- •ARC Prize 측은 익숙지 않은 환경에서의 자율 탐색·계획을 가능케 한 논리 추론 향상을 원인으로 분석
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence

- 1.Claude Opus 5, ARC-AGI-3 30.2%로 신기록…이전 기록 GPT-5.6 Sol(7.8%)의 약 4배
- 2.미해결 환경 5개 첫 해결(4개는 인간 수준 이상), Fable급 모델(약 20%)도 크게 앞서
- 3.과제를 대수 표기로 번역하고 반사 방정식을 자체 수립하는 등 전례 없는 행동 관찰
- 4.사설 벤치마크 Witness선 43.4로 Kimi K3·Fable 5와 통계적 동률, 향상 폭 훨씬 작아
왜 중요한가?
ARC-AGI-3 공개 이후 개발된 모델이라 벤치마크 표적 학습 가능성이 제기되는 만큼, 4배 격차가 범용 추론 향상인지 특정 퍼즐 형식 최적화인지가 프런티어 모델 평가 방법론 논쟁의 핵심 쟁점이 됐다.
본문 미리보기
Anthropic's Claude Opus 5 scored 30.2 percent on ARC-AGI-3, nearly quadrupling GPT-5.6 Sol's previous record of 7.8 percent. The benchmark's developers say the model independently formulated reflection equations, a behavior they had never seen from another model, and attribute to stronger logical reasoning. The article Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:13AI 초안

