KV-PRM은 프로세스 보상 모델(PRM)이 전체 궤적 텍스트를 처음부터 재인코딩하는 대신 LLM 생성 과정에서 자연히 만들어지는 KV 캐시를 직접 읽어 채점하는 고효율 보상 모델이다. 단일 '검증 토큰'을 기존 KV 캐시에 대해 처리해 채점 비용을 O(L²)에서 O(L)로 낮췄으며, KV 캐시가 텍스트보다 엄밀히 더 많은 정보를 담는다는 것도 형식적으로 증명했다. MATH·GSM8K·AIME 벤치마크에서 Beam Search, MCTS, Weighted Voting 등 테스트 시간 스케일링 기법과 결합했을 때 텍스트 PRM과 대등하거나 더 나은 성능을 보였고, 채점 FLOPs 최대 5,000배, 지연시간 37배, 시퀀스당 메모리 34배 절감을 달성했다. 긴 멀티 에이전트 롤아웃에서 PRM 병목을 해소하는 실용적 돌파구다.
- •텍스트 재인코딩 없이 생성 시 만들어진 KV 캐시를 직접 읽어 채점하는 방식
- •채점 복잡도를 O(L²)에서 O(L)로 감소, KV 캐시가 텍스트보다 정보량이 크다는 점도 증명
- •MATH·GSM8K·AIME에서 텍스트 PRM과 대등하거나 우수한 성능
- •채점 FLOPs 최대 5,000배, 지연시간 37배, 메모리 34배 절감
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling
- 1.텍스트 재인코딩 없이 KV 캐시를 직접 읽는 프로세스 보상 모델 KV-PRM 제안
- 2.단일 verify 토큰으로 채점 비용을 O(L²)에서 O(L)로 감축
- 3.KV 캐시가 텍스트보다 정보 용량이 크다는 점을 형식적으로 증명
- 4.MATH·GSM8K·AIME에서 텍스트 PRM 동등 이상 성능, FLOPs 최대 5000배 절감
왜 중요한가?
긴 멀티에이전트 롤아웃에서 PRM 채점 비용이 병목이던 문제를 생성 과정의 부산물인 KV 캐시 재활용으로 해결했다. 지연 37배·메모리 34배 절감으로 테스트타임 스케일링을 장문 컨텍스트 환경까지 실용화하는 진전이다.
언급 프로젝트
본문 미리보기
arXiv:2607.09153v1 Announce Type: new Abstract: Process Reward Models (PRMs) have been proven to be highly effective in guiding test-time scaling (TTS) methods, which significantly boost the capabilities of LLM-based multi-agent systems. However, existing PRMs are text-based: they re-encode the entire trajectory text from scratch. In long multi-agent rollouts, the scoring cost, growing quadratically with respect to sequence length L, creates a severe computational bottleneck, severely limiting
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

