실세계 멀티 에이전트 강화학습에서 외부 자연어 명령어가 진행 중인 행동을 중단할 때 발생하는 가치 추정 불일치를 해결하는 MAVIC 프레임워크를 소개합니다. 명령어 경계에서 벨만 백업을 보정하여 현재 명령어 목표와 이후 연속 가치를 일관되게 유지하며, 보상 형성이 아닌 부트스트랩 목표 자체를 수정합니다. 단일 통합 정책 내에서 확률론적 명령어 전환 시에도 일관된 가치 추정을 가능하게 하며, 복잡한 협동 환경에서 높은 명령어 준수율과 기본 성능을 동시에 달성했습니다.
- •MAVIC은 멀티 에이전트 RL에서 명령어 전환 시 발생하는 가치 추정 불일치를 해결
- •벨만 백업 보정으로 명령어 경계에서 일관된 가치 추정 보장
- •보상 형성이 아닌 부트스트랩 목표 수정으로 단일 정책 내 명령어 전환 처리
- •협동 멀티 에이전트 환경에서 높은 명령어 준수율과 기본 성능 동시 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Macro-Action Based Multi-Agent Instruction Following through Value Cancellation
- 1.외부 지시가 장기 목표와 충돌할 때 발생하는 MARL 가치 추정 불일치를 수정하는 MAVIC 제안
- 2.벨만 업데이트 경계에서 목표 수정과 연속 가치 복원으로 일관된 가치 추정 달성
- 3.보상 형성 대신 부트스트래핑 타겟 수정으로 확률적 지시 전환 하에서도 통합 정책 유지
- 4.복잡한 협력 다중 에이전트 환경에서 기본 과제 성능 유지하며 높은 지시 이행률 달성
왜 중요한가?
실세계 다중 에이전트 시스템에서 외부 지시와 장기 목표 사이의 근본적 충돌을 이론적으로 분석하고 실용적 해결책을 제시해, MARL의 실제 배포 가능성을 높인다.
언급 프로젝트
본문 미리보기
arXiv:2605.12655v1 Announce Type: new Abstract: Multi-agent reinforcement learning (MARL) in real-world use cases may need to adapt to external natural language instructions that interrupt ongoing behavior and conflict with long-horizon objectives. However, conditioning rewards on instructions introduces a fundamental failure mode as Bellman updates couple value estimates across instruction contexts, leading to inconsistent values when instructions interrupt macro-actions. We propose Macro-Acti
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

