멀티 에이전트 전략 게임에서 언어 모델 훈련의 핵심 난제는 행동 품질이 미래 사건·규칙 위반·타 플레이어 결정에 의존한다는 점이다. 이 연구는 에피소드 종료 시 보상을 역전파하고 유효한 종속 정보가 없는 스텝을 훈련에서 제외하는 '적격 게이팅을 가진 지연 단계별 보상 귀인' 방법을 도입한다. NeurIPS 2025 MindGames Arena에서 8B 파라미터 오픈소스 모델이 GPT-5를 포함한 훨씬 큰 독점 모델들을 능가하며 공개·효율(≤8B) 트랙 양쪽에서 1위를 차지했다.
- •에피소드 종료 시 보상을 역전파하고 유효한 종속 정보가 없는 스텝을 제외하는 지연 단계별 보상 귀인으로 멀티 에이전트 환경의 RL 크레딧 할당 문제를 해결한다.
- •vLLM 연속 배칭 비동기 롤아웃 생성, 커리큐럼 기반 상대 샘플링, 다단계 계층화 배치 구성으로 안정적이고 샘플 효율적인 RL 학습을 달성한다.
- •8B 파라미터 오픈소스 모델이 GPT-5를 포함한 대형 독점 모델을 능가해, 방법론적 혁신이 모델 크기를 대체할 수 있음을 입증했다.
- •NeurIPS 2025 MindGames Arena 공개 트랙과 효율(≤8B) 트랙 양쪽에서 1위를 기록했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution
- 1.에피소드 종료 시점에만 보상을 계산해 원래 스텝으로 역전파하는 '지연 스텝별 보상 귀속' 기법 제안
- 2.유효 정보 없는 스텝은 학습에서 제외(eligibility gating)하고 vLLM 연속 배칭으로 비동기 롤아웃 생성
- 3.80억 파라미터 오픈소스 모델이 GPT-5 등 더 큰 독점 모델과 정면 대결에서 대등하거나 능가
- 4.NeurIPS 2025 MindGames Arena의 Open·Efficient 트랙 모두 1위 차지
왜 중요한가?
다중 에이전트 전략 상호작용에서 스텝별 보상 할당이라는 표준 RL 가정이 무너지는 문제를 해결해, 8B 오픈소스 모델로도 대형 독점 모델을 능가하는 안정적·샘플 효율적 학습이 가능함을 벤치마크 1위로 실증했다.
언급 프로젝트
다중 에이전트 전략 상호작용 환경에서 언어 모델 에이전트를 훈련하는 난제를 해결하려는 이 연구는 국내 AI 기술 발전에 중요한 의미를 가집니다. 미래 예측 불확실성 속에서 보상 귀속 문제를 다루는 '지연된 단계별 보상 귀속' 방식은 자율주행, 스마트 시티 등 복잡한 환경에 적용될 국내 AI 에이전트의 일반화 능력과 신뢰성을 크게 향상시킬 것입니다.
본문 미리보기
arXiv:2606.00017v1 Announce Type: new Abstract: Training language model agents for multi-agent strategic interaction presents a core difficulty: the quality of any action may depend on future events that never materialize, on moves that violate game rules, or on decisions made by other players. Standard reinforcement learning assumes that rewards can be assigned at each step, but this assumption fails in settings where outcomes are entangled across time and agents. We introduce delayed per-step
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

