협동 다중 에이전트 강화학습(MARL)에서 동질 에이전트의 역할 분화 문제를 무작위성을 활용해 해결하는 Diamond Attention을 제안합니다. 완전한 파라미터 공유 환경에서 순열 대칭 관찰이 주어지면 결정론적 정책은 역할 분화가 불가능합니다. Diamond Attention은 각 에이전트가 타임스텝마다 스칼라 난수를 샘플링하고 이를 통해 임시 순위를 형성하여 하위 에이전트를 어텐션에서 마스킹합니다. XOR 게임에서 성공률 1.0, 다양한 팀 크기의 제로샷 일반화, SMACLite 제로샷 전이에서 우수한 결과를 입증했습니다.
- •동질 에이전트의 완전한 파라미터 공유와 순열 대칭 관찰 환경에서 결정론적 정책은 역할 분화가 구조적으로 불가능하며, 이론적으로 무작위성이 필요하다.
- •Diamond Attention은 각 에이전트가 타임스텝마다 스칼라 난수를 샘플링하여 임시 순위를 형성하고 하위 순위 에이전트를 에이전트 간 어텐션에서 마스킹하는 무작위 비트 조율 프로토콜이다.
- •집합 기반 어텐션 덕분에 N=4로 훈련한 정책을 N∈[2,8] 팀 크기에 제로샷으로 배포할 수 있으며, SMACLite에서 기존 결정론적 기법이 실패하는 시나리오 전이도 성공했다.
- •단순한 드롭아웃 기반 무작위성은 승률 0%를 보여, 성능의 핵심 요인이 확률적 노이즈가 아닌 프로토콜 공간의 구조임을 확인했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Randomness is sometimes necessary for coordination
- 1.동형 에이전트 간 역할 분화를 위해 구조화된 무작위성이 필수적임을 이론·실험으로 입증
- 2.각 에이전트가 랜덤 스칼라를 샘플링해 순위 순서를 생성하는 Diamond Attention 아키텍첸 제안
- 3.XOR 게임에서 1.0 성공률 달성, N=4 훈련 후 N∈[2,8]에 제로샷 일반화
- 4.SMACLite에서 표준 기준선이 실패한 제로샷 크로스 시나리오 전이를 성공적으로 달성
왜 중요한가?
협력 다중 에이전트 강화학습에서 대칭성 문제를 해결하는 원리적 방법을 제시하며, 팀 크기에 무관한 제로샷 배포 가능성을 입증한 의미 있는 연구다.
언급 프로젝트
본문 미리보기
arXiv:2605.06825v1 Announce Type: new Abstract: Full parameter sharing is standard in cooperative multi-agent reinforcement learning (MARL) for homogeneous agents. Under permutation-symmetric observations, however, a shared deterministic policy outputs identical action distributions for every agent, making role differentiation impossible. This failure can theoretically be resolved using symmetry breaking among anonymous identical processors, which requires randomness. We propose Diamond Attenti
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

