오픈AI는 GPT-5.6 솔이 자사 API에 '보존된 추론'과 '압축' 두 가지 설정을 추가 적용했을 때 ARC-AGI-3 벤치마크에서 38.3%를 기록해 앤트로픽 클로드 오퍼스 5의 30.2%를 넘어섰다고 주장했다. 다만 공식 테스트 환경에서는 추론 과정이 매 행동 후 폐기돼 GPT-5.6 솔의 점수가 7.8%에 그쳤다. ARC 프라이즈 공동창립자 프랑수아 숄레는 벤치마크 형식을 겨냥해 특수 제작된 하네스는 허용되지 않지만, 모든 API 사용자가 쓸 수 있는 범용 설정은 공정하다는 입장을 밝히며 오픈AI의 접근을 일부 인정했다. 그는 서로 다른 제공업체가 다른 설정을 쓰는 데서 오는 '공정성 문제'가 있을 수 있지만 설정과 비용이 명확히 공개되는 한 용인할 수 있다고 덧붙였다.
- •오픈AI, GPT-5.6 솔이 자사 API 추가 설정으로 ARC-AGI-3에서 38.3% 기록해 클로드 오퍼스 5의 30.2% 초과 주장
- •공식 테스트 환경에서는 추론 폐기로 GPT-5.6 솔 점수가 7.8%에 그침
- •ARC 프라이즈 공동창립자 프랑수아 솨레, 범용 API 설정은 공정하다며 오픈AI 접근 일부 인정
- •제공업체별 설정 차이에 따른 공정성 논란 여지, 설정·비용 공개를 전제로 용인된다는 입장
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings
본문 미리보기
OpenAI counters Anthropic's ARC-AGI-3 record: GPT-5.6 Sol scores 38.3 percent, but only with its own API features instead of the official test setup, where the model landed at 7.8 percent. ARC Prize claims its test environment is provider-neutral, but may have used an outdated API that skewed the comparison with Opus 5. The article OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:54AI 초안

