오프-폴리시 TD 학습에서 안정성과 분산 제어의 균형을 다루는 연구로, Regularized Emphatic Temporal-Difference Learning(RETD)을 제안한다. 기존 Emphatic TD는 팔로우온 추적의 높은 분산 문제가 있으며, 단순한 중심화 확장은 핵심 행렬의 양의 정치성을 파괴할 수 있다. RETD는 커플된 핵심 행렬의 하우-우측 블록을 1에서 (1+c)로 조정해 보조 중심화 재귀만 정규화함으로써 안정성과 유리한 강조 기하구조를 동시에 보존한다.
- •Emphatic TD는 팔로우온 강조로 오프-폴리시 투영 기하학을 개선하지만, 팔로우온 추적의 높은 분산 문제가 있다.
- •나이브한 중심화 강조 확장은 ETD 핵심 행렬의 양의 정치성을 파괴해 불안정을 야기할 수 있다.
- •RETD는 커플된 핵심 행렬의 하우-우측 블록을 1에서 (1+c)로 올려 보조 중심화 재귀만 정규화한다.
- •진단용 선형 오프-폴리시 예측 실험에서 RETD는 불안정성을 피하면서 유리한 강조 기하구조를 보존했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Regularized Centered Emphatic Temporal Difference Learning
- 1.오프폴리시 TD 학습의 안정성·투영 기하·분산 제어 트레이드오프 재검토
- 2.중심화된 Emphatic TD 확장이 ETD 키 행렬의 양정치성을 파괴하는 문제 발견
- 3.정규화된 Emphatic TD 학습(RETD) 제안으로 ETD 안정성과 유리한 기하 보존
- 4.진단적 선형 오프폴리시 예측 실험에서 RETD의 강건한 정규화 레징 확인
왜 중요한가?
강화학습의 오프폴리시 학습 안정성 문제는 실용적 RL 시스템 구축의 핵심 과제이며, RETD는 이론적 수렴 보장과 실험적 강건성을 모두 갖춘 해법을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2605.04100v1 Announce Type: new Abstract: Off-policy temporal-difference (TD) learning with function approximation faces a structural tradeoff among stability, projection geometry, and variance control. Emphatic TD (ETD) improves the off-policy projection geometry through follow-on emphasis, but the follow-on trace can have high variance. We revisit this tradeoff through Bellman-error centering. Although centering naturally removes a common drift term from TD errors, we show that a naive
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

