ARC-AGI-1에서 벤치마크 특화 학습이나 대규모 테스트타임 연산 없이, 에이전트 아키텍처만으로 성능을 끌어올린 연구다. 비추론 모드의 DeepSeek V3.2를 엄격한 예산 하에 사용해, 패턴 발견과 프로그램 합성을 분리한 Explorer-Definer 파이프라인과, 가설 실패 시 새 변환을 자율 탐색하는 Reflective Orchestrator를 구축했다. 공개 400과제 평가에서 파이프라인은 과제당 $0.25로 pass@2 57.50%, 오케스트레이터는 $0.62로 67.25%를 달성해 15.50% 원샷 베이스라인을 약 52%p 끌어올렸다. pass@k 분석 결과 병목은 후보 선별이 아닌 생성 다양성임이 확인됐고, 적응적 재탐색이 이를 입증했다. 저비용 하네스 설계만으로 추상 추론 성능을 크게 회복할 수 있음을 보여준다.
- •비추론 모드 DeepSeek V3.2 + ARC 특화 학습 없이 아키텍처만으로 성능 회복 연구
- •패턴 발견과 변환 합성을 분리한 Explorer-Definer 파이프라인: pass@2 57.50%, 과제당 $0.25
- •실패 시 자율 재탐색하는 Reflective Orchestrator: pass@2 67.25%, 과제당 $0.62
- •15.50% 원샷 베이스라인 대비 약 52%p 향상
- •pass@k 분석으로 병목이 선별이 아닌 생성 다양성임을 규명, think 툴 제거 시 5.75%p 하락
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1
- 1.ARC 특화 학습 없이 DeepSeek V3.2 비사고 모드+하니스만으로 ARC-AGI-1 성능 대폭 향상
- 2.Explorer-Definer 파이프라인 57.5%, Reflective Orchestrator 67.25% pass@2 달성
- 3.과제당 $0.25~0.62 비용으로 15.5% 원샷 베이스라인을 약 52%p 끌어올림
- 4.pass@k 분석상 병목은 선택 아닌 생성, 적응적 재탐색으로 pass@1 +9.81%p 확인
왜 중요한가?
고비용 테스트타임 컴퓨트나 벤치마크 특화 파인튜닝 없이 하니스 아키텍처 설계만으로 추상 추론 성능을 크게 끌어올릴 수 있음을 입증해, 저비용 오픈 모델 기반 에이전트 설계의 여지를 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2607.06764v1 Announce Type: new Abstract: Recent progress on ARC-AGI-1 from disclosed architectures has come broadly from two regimes: heavy test-time compute over frontier models (evolutionary search, exhaustive sampling, extended chain-of-thought), or benchmark-specific training in which small models are fine-tuned on ARC data, often with task-specialized architectures. We study a third regime: an open-weight model in non-thinking mode (DeepSeek V3.2) under a strict budget, with no ARC-
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

