오프라인-온라인 강화학습에서 가치 과대추정 문제를 해결하기 위해 자기지도 다중항 순위 손실을 TD 학습에 결합하는 RankQ를 제안합니다. 획일적인 외부 분포 행동 패널티 대신 상대적 행동 선호도를 학습하여 하위 최적 데이터셋에서도 온라인 정책 개선을 촉진합니다. 비전 기반 로봇 학습에서 실제 세계 큐브 쌓기 성공률을 43.1%에서 84.7%로 크게 향상시켰습니다.
- •RankQ는 TD 학습에 자기지도 다중항 순위 손실을 결합하여 구조화된 행동 순서를 학습합니다.
- •회일적 패널티 대신 상대적 행동 선호도를 학습하여 하위 최적 데이터에서도 온라인 개선이 가능합니다.
- •D4RL 희소 보상 벤치마크에서 7개 기존 방법 대비 경쟁력 있는 성능을 달성했습니다.
- •실제 로봇 큐브 쌓기 실험에서 성공률을 43.1%에서 84.7%로 크게 향상시켰습니다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking
- 1.자기지도 다중 항 랜킹 손실로 Q함수를 구조화하는 오프라인→온라인 RL 알고리즘 RankQ 제안
- 2.균일한 비분포 행동 패널티 대신 상대적 행동 선호도를 학습하여 정책 개선
- 3.D4RL 희소 보상 벤치마크에서 7개 선행 방법 대비 경쟁력 있는 성능
- 4.실세계 큐브 스태킹 성공률 43.1%에서 84.7%로 향상
왜 중요한가?
기존 오프라인→온라인 RL의 비관주의 한계를 구조적 행동 순서화로 극복하여, 로봇 학습과 같은 실세계 응용에서 실질적인 성능 향상을 달성한다.
언급 프로젝트
본문 미리보기
arXiv:2605.11151v1 Announce Type: new Abstract: Offline-to-online reinforcement learning (RL) improves sample efficiency by leveraging pre-collected datasets prior to online interaction. A key challenge, however, is learning an accurate critic in large state--action spaces with limited dataset coverage. To mitigate harmful updates from value overestimation, prior methods impose pessimism by down-weighting out-of-distribution (OOD) actions relative to dataset actions. While effective, this essen
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

