이 연구는 다중 에이전트 강화학습에서 '언제 소통할지'를 매 시점 통신이나 불안정한 REINFORCE 이진 게이트 대신, 에이전트 간 믿음 분포의 KL 발산이 임계값을 넘을 때만 소통하는 원칙적 방식으로 결정하는 방법을 제안한다. Predator-Prey 20×20 환경에서 임계값 ε=0.5일 때 평균 73.84스텝, 성공률 42%를 기록해 IC3Net(75.31스텝, 31%)을 앞섰고, 시드 간 분산도 더 작았다. MPE simple_spread에서는 게이팅이 비활성 상태여도 믿음 헤드만으로 평균 보상이 12점 향상되고 분산이 26배 줄어, 원칙적 게이팅과 개선된 잠재 표현이라는 두 가지 독립적 기여가 확인됐다. 다만 더 쉬운 10×10 환경에서는 IC3Net이 모든 임계값에서 KL-믿음 방식을 앞서는 한계도 나타났다.
- •믿음 분포 간 KL 발산이 임계값을 넘을 때만 통신하는 원칙적 게이팅 제안
- •PP 20×20에서 ε=0.5가 IC3Net 대비 성공률 11%p, 스텝 1.47 개선
- •MPE에서 게이팅 비활성 시에도 보상 12점 상승, 분산 26배 감소
- •믿음 표현 개선과 원칙적 게이팅이라는 두 독립적 효과 확인
- •더 쉬운 PP 10×10 환경에서는 IC3Net이 모든 임계값에서 우세
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When to Communicate: Belief Distributions and KL Divergence for Principled Gating in Multi-Agent RL
- 1.KL발산 임계값 기반 통신 게이팅 제안, IC3Net의 고분산 REINFORCE 방식 대체
- 2.PP 20×20에서 임계값 0.5 적용 시 성공률 42%(IC3Net 31%), 스텝수 73.84로 우세
- 3.MPE simple_spread에서 평균 보상 12점 향상, 분산은 26배 감소
- 4.게이팅 비활성 상태에서도 표현력 개선 효과 확인, 두 가지 독립적 기여 요인 규명
왜 중요한가?
멀티에이전트 강화학습에서 불안정한 REINFORCE 기반 통신 게이팅을 원칙적 신념분포 기준으로 대체해, 더 해석 가능하고 안정적인 통신 정책 설계가 가능함을 보였다.
본문 미리보기
arXiv:2608.14559v1 Announce Type: new Abstract: Effective communication in multi-agent reinforcement learning requires agents to decide not only \textit{what} to communicate, but when? Existing approaches either communicate at every timestep or learn a binary gate through REINFORCE policy gradients \cite{singh2019}, a high-variance signal that produces unstable and uninterpretable gating behavior. I propose a principled alternative: agents communicate only when the KL divergence between their l
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
