CAPS(계단식 적응형 쌍별 선택)는 병렬 추론에서 검증기 계산을 비균일하게 배분하는 추론 전용 프레임워크다. 증거 축과 분포 축이라는 두 직교 축을 따라 적응하며, 선택적 구조 서브루틴을 포함한 4단계 캐스케이드로 구현된다. 코드 및 수학 벤치마크 20개 중 14개에서 선도적 쌍별 검증기를 능가하면서 검증기 토큰 예산의 25.4%만 사용했다. 기존 균일 풀 증거 일정 대비 후보당 한계 비용이 약 절반으로 줄어들며, 캐스케이드 적합성에 대한 구체적인 배포 전 점검 방법도 제공한다.
- •CAPS는 검증기 계산을 증거 축(후보를 얼마나 볼지)과 분포 축(비교를 어떻게 분산할지)에서 비균일하게 배분한다.
- •코드 벤치마크에서 검증기 토큰 예산의 25.4%만 사용하면서 20개 벤치마크 중 14개에서 주요 쌍별 검증기를 능가했다.
- •포인트별 자기 검증 방법 대비 20개 모든 벤치마크에서 성능이 우수하다.
- •캐스케이드 단계별 폐쇄형 비용 공식을 제공해 배포 전 적합성을 진단할 수 있다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
CAPS: Cascaded Adaptive Pairwise Selection for Efficient Parallel Reasoning
- 1.CAPS는 병렬 추론 검증에서 토큰을 비균일하게 할당해 비용을 절감하는 추론 전용 프레임워크
- 2.증거 축과 분포 축에서 비교 연산량을 적응적으로 줄여 검증 효율 향상
- 3.코드·수학 벤치마크 20개 중 14개에서 최고 성능, 검증 토큰 25.4%만 사용
- 4.단일 정답 검증 방식보다 모든 벤치마크에서 우수한 성능 달성
왜 중요한가?
테스트 시간 스케일링에서 페어와이즈 자기검증의 비용을 대폭 줄이면서도 정확도를 유지해, 추론 효율과 성능을 동시에 개선하는 실용적 방법을 제시한다.
본문 미리보기
arXiv:2605.15513v1 Announce Type: new Abstract: Parallel reasoning, where a generator samples many candidate solutions and an aggregator selects the best, is one of the most effective forms of test-time scaling in large language models, and pairwise self-verification has become its strongest aggregation primitive. Yet pairwise verification carries a heavy cost: each judgment reads two complete solutions in full, and existing methods perform tens of such judgments per problem regardless of wheth
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

