이 논문은 복잡한 순차적 과제를 위한 강화학습 기반 제어 설계 프레임워크를 제안한다. Reward Machines(RM)의 개념을 Signal Temporal Logic(STL)으로 확장해 이벤트 생성에 활용한다. STL 사용은 복잡한 과제의 보상을 효율적으로 표현하고 명세된 요구사항을 만족하는 행동 쪽으로 학습을 유도한다. STL 온라인 모니터링 알고리즘을 활용한 구현도 제안하며, minigrid, cart-pole, highway 3개 환경에서 비자명한 과제로 검증했다.
- •Reward Machines를 Signal Temporal Logic으로 확장한 RL 제어 프레임워크
- •STL 기반 보상 설계로 복잡 과제도 효율적으로 표현
- •STL 온라인 모니터링 알고리즘 활용 구현 제시
- •minigrid/cart-pole/highway 3개 환경에서 비자명 과제 검증
- •명세된 요구사항을 만족하는 정책으로의 수렴 유도
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
On Tackling Complex Tasks with Reward Machines and Signal Temporal Logics
- 1.시간 논리 기반 보상 설계로 복잡 RL 과제 학습 가이드
- 2.자율주행·로봇 제어 등 시퀀셜 안전 제약 과제에 적용 가능
- 3.Reward Machines의 표현력 한계를 STL로 확장
왜 중요한가?
복잡한 순차 과제를 RL로 풀 때 보상 설계가 핵심 난관인데, STL 같은 형식 논리를 보상에 결합하면 명세된 안전·성능 요구사항을 직접 학습 시그널로 전환할 수 있다.
본문 미리보기
arXiv:2604.14440v1 Announce Type: new Abstract: We propose a Reinforcement Learning (RL) based control design framework for handling complex tasks. The approach extends the concept of Reward Machines (RM) with Signal Temporal Logic (STL) formulas that can be used for event generation. The use of STL allows not only a more efficient representation of rewards for complex tasks but also guiding the training process to converge towards behaviors satisfying specified requirements. We also propose an
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 22:30AI 초안

