대형 추론 모델(LRM)은 다단계 사고연쇄(CoT)로 문제 해결력을 향상시키지만 추론 지연과 계산 비용이 크다. 이를 완화하기 위한 소형 추론 모델(SRM)·LRM 협업 패러다임에서 SRM 실패 탐지·완화는 핵심 과제다. 저자들은 SRM 추론을 텍스트 및 은닉 상태 공간에서 분석해 과신·불확실성·과도한 재검증이라는 세 가지 실패 양상을 식별했다. 이를 바탕으로 텐서 랭크 신호 기반 라우팅과 스티어링을 결합한 RankGuide 프레임워크를 제안해 SRM 실패 시 LRM을 선택적으로 호출하고 SRM 생성 품질을 개선했다. 다중 추론 벤치마크 실험에서 RankGuide는 LRM 대비 최대 1.75배의 지연 감소와 경쟁력 있는 정확도를 동시에 달성했다.
- •SRM 실패 양상을 과신·불확실성·과도한 재검증 세 가지로 분류
- •텐서 랭크 신호 기반 라우팅으로 LRM 선택적 호출
- •텐서 랭크 필터링 스티어링 벡터로 SRM 추론 궤적 조정
- •다중 추론 벤치마크에서 LRM 대비 최대 1.75배 지연 감소
- •지연 감소와 정확도 유지를 동시에 달성한 SRM-LRM 협업 효율 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
RankGuide: Tensor-Rank-Guided Routing and Steering for Efficient Reasoning
- 1.RankGuide는 SRM-LRM 협업 효율화 프레임워크
- 2.작은 추론 모델의 과신·불확실·재검증 3가지 실패 모드 식별
- 3.텐서 랭크 신호 기반 라우팅과 스티어링 결합
- 4.LRM 대비 최대 1.75배 속도 향상 및 정확도 유지
왜 중요한가?
대형 추론 모델의 지연과 비용을 줄이면서 작은 모델의 실패를 효과적으로 탐지·완화하는 방법을 제시합니다.
언급 프로젝트
본문 미리보기
arXiv:2604.16694v1 Announce Type: new Abstract: Large reasoning models (LRMs) enhance problem-solving capabilities by generating explicit multi-step chains of thought (CoT) reasoning; however, they incur substantial inference latency and computational overhead. To mitigate this issue, recent works have explored model collaboration paradigms, where small reasoning models (SRMs) generate intermediate reasoning steps to achieve a better accuracy--latency trade-off. Despite recent progress, effecti
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:43AI 초안

