사람의 선호를 학습하는 보상 모델(reward model) 중 희소 전문가 혼합(MoE) 구조는 프롬프트를 전문가에게 라우팅해 해석 가능성을 높이려 하지만, 기존에는 라우팅 가중치가 높은 예시만으로 전문가를 설명해 어떤 프롬프트를 받는지만 보여줄 뿐 응답을 어떻게 판단하는지는 드러내지 못하는 한계가 있었다. 연구진은 채택-거부 응답 쌍 중 기여도 대비가 가장 큰 사례를 이용해 전문가 행동을 라우팅과 선호 판단 양쪽에서 포착하는 '기여도 대비(CoCo)' 응답 수준 해석 기법을 제안했다. 자동·인간 평가 모두에서 CoCo는 라우터 기반, 점수 기반, 희소 오토인코더 기반 대안보다 더 일관되고 충실하며 전문화된 해석을 제공하면서도 보상 모델링 정확도는 유지했다. 이는 MoE 보상 모델 해석 방법을 체계적으로 연구한 첫 사례로 소개된다.
- •기존 MoE 보상 모델 해석은 라우팅 가중치만 봐 전문가의 판단 방식을 설명하지 못했다.
- •연구진은 채택-거부 응답 쌍의 기여도 대비를 이용한 'CoCo' 해석 기법을 제안했다.
- •CoCo는 라우팅과 선호 판단을 동시에 포착해 더 충실하고 전문화된 해석을 제공한다.
- •자동·인간 평가 모두에서 기존 라우터·점수·오토인코더 기반 방법보다 우수했다.
- •보상 모델링 정확도를 유지하면서 해석 가능성을 높인 첫 체계적 연구로 소개된다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast
본문 미리보기
arXiv:2608.06400v1 Announce Type: new Abstract: Reward models are central to learning from human preferences, yet identifying what drives their predictions remains challenging. Recent sparse Mixture-of-Experts (MoE) reward models seek to improve interpretability by routing prompts to specialized experts and characterizing experts through examples with high routing weights. However, routing weights only reveal which prompts an expert $\textit{receives}$, not how it $\textit{judges}$ responses, p
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

