COMAD는 오프라인 멀티에이전트 데이터에서 협조 스킬을 지속적으로 발견·재사용하는 연속 학습 프레임워크다. 과제가 순차적으로 등장하고 스킬 공간이 기하급수적으로 커지는 환경에서, 고정 크기 스킬 라이브러리에 의존하는 기존 방법은 분포 이동과 간섭으로 파국적 망각과 가소성 손실을 겪는다. COMAD는 오토인코더로 혼합 행동 데이터에서 협조 지식을 재사용 가능한 스킬로 변환하고, 밀도 기반 재사용성 추정기로 식별한 스킬이 어드밴티지 함수를 명시적으로 유도하는 멀티헤드 스킬 증강 정책 학습 목표를 구성한다. 이론적으로 연속 스킬 발견 문제의 최적해를 근사함을 보였고, 다양한 MARL 벤치마크에서 스킬 라이브러리를 지속 확장하며 여러 베이스라인보다 우수한 순방향·역방향 전이를 달성했다. ICML 2026 채택작이다.
- •순차적 과제 환경에서 고정 스킬 라이브러리의 파국적 망각·가소성 손실 문제를 결함
- •오토인코더로 혼합 행동 데이터의 협조 지식을 재사용 가능한 스킬로 변환
- •밀도 기반 재사용성 추정기 + 멀티헤드 구조의 스킬 증강 정책 학습 목표 구성
- •연속 스킬 발견 문제의 최적해 근사를 이론적으로 증명
- •다양한 MARL 벤치마크에서 우수한 순방향·역방향 전이 달성, ICML 2026 채택
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Offline Multi-agent Continual Cooperation via Skill Partition and Reuse
- 1.연속적 오프라인 멀티에이전트 스킬 발견 프레임워크 COMAD 제안
- 2.오토인코더로 협응 지식을 재사용 가능한 스킬로 변환
- 3.밀도 기반 재사용성 추정기로 멀티헤드 정책 학습의 어드밴티지 함수를 유도
- 4.다양한 MARL 벤치마크에서 간섭 완화·전후방 전이 성능 우위 달성
왜 중요한가?
과제가 순차적으로 늘고 스킬 공간이 폭증할 때 발생하는 파국적 망각·가소성 손실 문제를 스킬 분할·재사용으로 완화해, 개방형 환경의 지속학습 협력에 기여한다.
언급 프로젝트
본문 미리보기
arXiv:2606.25389v1 Announce Type: new Abstract: Extracting skills from multi-agent offline dataset improves learning efficiency via sharing task-invariant coordination skills among tasks. In settings where tasks occur sequentially and the space of skills grows exponentially, existing approaches that rely on heuristically designed and fixed-sized skill libraries struggle to resolve the problem of distributional shift and interference, facing catastrophic forgetting and plasticity loss. To addres
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

