블랙박스인 심층 강화학습 정책을 사람이 읽고 논리 엔진이 실행하며 최적화기가 편집할 수 있는 Prolog 프로그램으로 변환하는 3단계 사후(post-hoc) 기법이 제안됐다. 동결된 PPO 교사 정책에서 순서화된 규칙 리스트를 유도해 Prolog로 내보내고, 정책 평가로 수익 증가가 인증될 때만 규칙 편집을 수락한다. 이론적으로 return-loss 상한, 확장 루프의 단조 개선·종료, 해상도 B 증가에 따른 O(1/B) 불일치 수렴을 증명했고, 사선 결정 경계에서는 관측 차원에 지수적 비용이 든다는 하한도 제시했다. 실험에서 16,944 상태의 키-도어 과제는 전 시드에서 정확한 최적 수익을 달성했고, Acrobot은 11개 절로 신경망과 대등, CartPole은 수익의 약 97%를 회복했으나 LunarLander는 이론적 한계대로 부분 회복에 그쳤다. 설명가능한 RL의 형식 보증과 실증적 한계를 동시에 보여준다.
- •PPO 교사 추출→규칙 리스트 유도→Prolog 방출의 3단계 변환 + 수익 증가 인증 시에만 규칙 편집 수락
- •return-loss 상한, 단조 개선·종료, O(1/B) 수렴, 관측 차원 지수적 비용 하한 등 4가지 보증 증명
- •16,944 상태 키-도어 과제에서 전 시드 정확한 최적 수익 달성, 예산 제한 시 교사 능가
- •Acrobot은 11개 절로 신경망과 대등, CartPole 약 97% 회복, LunarLander는 이론적 한계대로 부분 회복
From Black Box to Executable Logic: Explainable Reinforcement Learning through Prolog Expert Systems
- 1.학습된 심층 RL 정책을 실행 가능한 Prolog 프로그램으로 바꾸는 3단계 사후 변환 제안
- 2.PPO 교사 정책에서 규칙 목록을 귀납, 수익 증가가 검증된 편집만 수용하는 확장 루프
- 3.수익 손실 한계 등 4개 이론 보장 증명, 연속 관측은 해상도 B 증가 시 불일치 O(1/B) 수렴
- 4.키-도어 과제 전 시드 최적 수익 달성, Acrobot·CartPole에서 신경망 교사 수준(약 97%) 재현
왜 중요한가?
블랙박스 RL 정책을 사람이 읽고 논리 엔진이 실행하며 최적화기가 편집할 수 있는 프로그램으로 바꾼 시도로, 안전 인증이 필요한 제어 시스템에 기계 검증 가능한 정책 인증서라는 새 방향을 제시한다.
본문 미리보기
arXiv:2607.15459v1 Announce Type: new Abstract: A trained deep reinforcement learning policy is a black box, and we ask whether it can be made explainable by rewriting it as an executable logic program that reproduces its behaviour and that a person can read, a logic engine can run, and an optimizer can edit. We present a three-stage post-hoc transformation that extracts a frozen proximal policy optimization teacher, induces an ordered rule list from its decisions in the manner of classical rel
전체 내용이 궁금하다면?
원문을 직접 읽어보세요