LAPO는 멀티턴 검색 추론 강화학습에서 각 검색 턴의 기여도를 스스로 산출하는 프로세스 보상 기법이다. 특정 턴과 그 검색 결과를 [DELETE] 토큰으로 치환한 뒤 정답의 평균 로그우도 변화(Answer-Likelihood Gain)를 측정해 해당 턴이 유용한지, 불필요한지, 해로운지를 구분하며, 원시 기여도와 방향이 일치하는 어드밴티지만 남기는 sign-consistency 게이팅을 적용한다. 별도의 보상 모델·검증기·LLM 심판 없이 작동하면서 지식집약 QA 7개 데이터셋에서 평균 EM 0.326을 기록, 최강 스텝 보상 베이스라인 IGPO를 0.053 앞섰다. 외부 감독 없이 정책 자체에서 프로세스 신호를 뽑아낼 수 있음을 보여 검색 에이전트 학습 비용을 낮출 실용적 대안이 된다.
- •턴과 검색 관찰을 [DELETE]로 치환해 정답 로그우도 변화를 재는 leave-one-turn 역방향 기여도 측정으로 턴별 프로세스 보상 생성
- •기여도 부호와 방향이 일치하는 정규화 어드밴티지만 남기는 sign-consistency 게이팅 적용
- •보상 모델·교사·검증기·LLM-as-a-Judge 등 추가 감독 불필요
- •지식집약 QA 7개 데이터셋 평균 EM 0.326으로 최강 베이스라인 IGPO 대비 +0.053
- •역방향 기여도와 게이팅이 상호보완적 효과를 낸다는 절제 실험 결과
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
- 1.검색 턴을 [DELETE]로 치환한 뒤 정답 로그우도 변화로 각 턴의 기여를 측정하는 LAPO 제안
- 2.보상모델·교사·검증기·LLM 판정자 없이 자체 생성 프로세스 보상 구현, 부호 일치 게이팅으로 노이즈 제거
- 3.7개 지식집약 QA 데이터셋 평균 EM 0.326 — 최강 스텝보상 베이스라인 IGPO 대비 +0.053
왜 중요한가?
멀티턴 검색 RL의 고질적 문제인 '최종 보상만으로는 중간 턴의 유용·유해를 구분 못함'을 별도 보상모델 없이 정책 자체의 회고적 귀속으로 해결했다. 검색 에이전트 학습의 비용과 복잡도를 낮추는 실용적 프로세스 감독 기법이다.
다중 턴 검색 추론에서 자체 생성 보상 방식을 제안하는 LAPO 연구는 한국의 대화형 AI 및 검색 에이전트 개발에 중요한 기술적 진보를 의미합니다. 최종 결과 보상 외에 중간 상호작용의 유용성을 평가하는 것은 국내 기업들이 개발하는 챗봇, 지능형 비서 등 복잡한 AI 시스템의 학습 효율성과 응답 품질을 크게 향상시킬 것입니다. 사용자 경험을 높이고 더욱 정교한 AI 서비스를 구현하려는 국내 개발자들에게 주목할 만한 연구입니다.
본문 미리보기
arXiv:2607.13501v1 Announce Type: new Abstract: Reinforcement learning for multi-turn search reasoning typically relies on terminal outcome rewards, which cannot distinguish useful, redundant, and harmful intermediate interactions. We propose LAPO, a self-generated process-supervision method based on backward leave-one-turn attribution. For each search turn, LAPO replaces the turn and its retrieval observation with a fixed [DELETE] placeholder and measures the resulting change in the current po
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

