다중 에이전트 테스트 시간 진화는 단일 에이전트 진화를 N번 복제하는 것이 아님을 주장하며, 개인·팀·집단 세 수준에서 진화를 수행하는 EVOCHAMBER를 제안합니다. 핵심인 CODREAM은 팀 실패 시 에이전트들이 협업 성찰을 통해 통찰을 강한 에이전트에서 약한 에이전트로 비대칭적으로 전달하여 전문화를 보존합니다. Qwen3-8B로 경쟁 수학 63.9%, 코드 75.7%, 다영역 추론 87.1%를 달성하며 최고 기준선 대비 수학에서 32% 상대적 향상을 보였습니다.
- •EVOCHAMBER는 개인·팀·집단 세 수준에서 테스트 시간 진화를 수행하는 훈련 불필요 프레임워크입니다.
- •CODREAM은 팀 실패 시 통찰을 강한 에이전트에서 약한 에이전트로 비대칭 전달하여 전문화를 보존합니다.
- •동일하게 초기화된 에이전트들에서 4~5개의 안정적인 틈새 전문가가 자발적으로 출현합니다.
- •경쟁 수학 63.9%, 코드 75.7%, 다영역 추론 87.1%로 최고 기준선 대비 수학 32% 상대적 향상을 달성했습니다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
EVOCHAMBER: Test-Time Co-evolution of Multi-Agent System at Individual, Team, and Population Scales
- 1.멀티 에이전트 테스트타임 진화를 개인·팀·집단 3개 레벨에서 구현하는 EVOCHAMBER 프레임워크 제안
- 2.CODREAM 협업 반성 프로토콜로 강→약 에이전트 비대칭 지식 전달 구현
- 3.Qwen3-8B로 수학 63.9%, 코드 75.7%, 다중 도메인 추론 87.1% 달성
- 4.동일 초기화 에이전트에서 4~5개 전문화 에이전트가 자발적으로 출현
왜 중요한가?
멀티 에이전트 시스템의 테스트타임 학습이 단일 에이전트 N개 복제와 근본적으로 다르며, 비대칭 지식 전달이 핵심 성능 동인임을 실증한다.
언급 프로젝트
본문 미리보기
arXiv:2605.11136v1 Announce Type: new Abstract: We argue that multi-agent test-time evolution is not single-agent evolution replicated N times. A single-agent learner can only evolve its own context and memory. A multi-agent system additionally evolves who collaborates, how they collaborate, and how knowledge flows across the population. These components have no single-agent counterpart and can produce phenomena such as emergent specialization. Yet prior test-time methods either confine experie
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

