연구진은 LLM 강화학습에서 기존처럼 성공 경로들의 확률을 합산하는 대신 최댓값을 취하는 '트로피컬 강화학습(Tropical RL)'을 제안했다. 트로피컬 반환(tropical semiring) 대수를 도입해 상태 가치를 '가장 그럴듯한 검증된 해의 로그확률'로 재정의하고, 서로 다른 롤아웃에서 나온 최적 접두사와 접미사를 결합해 진정한 조합적 추론을 가능하게 한다. 이를 구현한 학습 알고리즘 TROPIC은 Sokoban, Countdown, FrozenLake, WebShop 등 4가지 에이전트형 과제에서 기존 최강 온폴리시 기준선보다 최대 16퍼센트포인트 높은 성능을 보였다. 강화학습의 추정 방식뿐 아니라 대수 구조 자체를 바꾸는 접근이 LLM의 조합적 추론 능력을 크게 개선할 수 있음을 보여준다.
- •기존 강화학습은 성공 경로 확률을 합산해 특정 해가 강화되면 다른 미검증 해를 잊어버리는 문제가 있음
- •트로피컬 반환(max 연산) 대수를 도입해 상태 가치를 최고 검증 해의 로그확률과 재사용 가능한 경로로 정의
- •서로 다른 롤아웃에서 나온 최적 접두사·접미사를 결합하는 진정한 조합적 추론 가능
- •TROPIC 알고리즘, Sokoban·Countdown·FrozenLake·WebShop 4개 과제에서 최강 기준선 대비 최대 16%p 성능 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Tropical Reinforcement Learning
- 1.기존 강화학습은 성공 경로들의 확률을 모두 더하지만, Tropical RL은 최댓값만 취하는 트로피컬 대수로 바꿈
- 2.상태값을 가장 가능성 높은 검증된 해의 로그확률과 재사용 가능한 경로로 정의
- 3.다른 롤아웃에서 나온 최적의 앞부분과 뒷부분을 같은 상태에서 이어붙이는 진짜 조합(composition)이 가능해짐
- 4.Sokoban·Countdown·FrozenLake·WebShop 4개 과제에서 최강 온폴리시 베이스라인보다 최대 16%포인트 앞섬
왜 중요한가?
한 해법을 강화하면 다른 해법을 잊어버리는 기존 RL의 구조적 한계를 대수 자체를 바꿔 해결해, 여러 단계를 조합해야 하는 추론 과제에서 성능을 크게 높일 수 있는 방법을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2610.02478v1 Announce Type: new Abstract: Reinforcement learning for large language models typically maximizes expected return, adding up the probabilities of all successful trajectories. However, the classical sum formulation can only report how often the model policy succeeds, not which solution actually worked, and because probabilities sum to one, reinforcing one solution can make the model forget another that was never shown to be wrong. This makes expected return a poor fit for comp
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

