신호 시간 논리(STL)는 실시간 속성을 정의하고 만족도를 정량적으로 채점하는 강건성 점수를 제공한다. 기존 연구는 이 강건성 점수를 강화학습(RL) 보상으로 사용해 STL 명세를 만족하는 제어 정책을 학습했지만, 강건성이 실행 이력에 의존하기 때문에 중첩된 시간 연산자를 포함한 장기 명세에서는 상태공간이 다루기 힘들 정도로 커진다는 문제가 있었다. 이 논문은 STL 명세로부터 시간 교대 오토마타를 구성하고 오토마타의 위치와 시계값으로 상태공간을 증강한 뒤 오토마타의 수락 조건에서 보상을 도출하는 새로운 오토마타 기반 방법을 제시한다. 실험 결과 이 방법으로 학습한 정책은 기존 강건성 기반 보상 방식보다 더 높은 강건성 점수와 만족률을 달성했다.
- •STL 명세로부터 시간 교대 오토마타를 구성해 마르코프 보상을 부여하는 새로운 RL 메커니즘 제안.
- •오토마타 위치와 시계값으로 상태공간을 증강해 장기 중첩 명세의 상태공간 폭발 문제를 해결.
- •기존 강건성 기반 보상 방식 대비 더 높은 강건성 점수와 만족률을 달성.
- •확량 모델 없이도 작동하는 학습 기반 제어에 적합한 마르코프 보상 설계.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reward Machines for Signal Temporal Logic
- 1.STL 명세 만족 제어정책을 위해 타임드 오토마타 기반 새 메모리·보상 메커니즘 제안
- 2.기존 로버스트니스 보상은 실행이력 의존으로 장기·중첩 명세에서 상태공간 폭발 문제 있었음
- 3.오토마타 상태·클록값 추가해 마르코프 보상으로 변환, 기존보다 높은 만족률 달성
왜 중요한가?
정확한 시스템 모델이 없는 자율 시스템에서도 실시간 안전요구사항을 강화학습만으로 충족시킬 실용적 방법을 제시해 검증가능한 제어 설계에 기여한다.
본문 미리보기
arXiv:2608.13625v1 Announce Type: new Abstract: Signal temporal logic (STL) provides a formal language for specifying real-time properties of real-valued observations, along with a quantitative robustness score for monitoring satisfaction. Control synthesis from STL specifications is of interest since manual controller design becomes infeasible as real-world systems grow in complexity. Moreover, many modern autonomous and AI-enabled systems lack accurate and complete system models, which makes
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

