COSPLAY — long-horizon 게임 환경에서 LLM 에이전트의 skill usage를 강화하는 co-evolution 프레임워크. LLM 결정 에이전트가 학습 가능한 skill bank에서 skill을 retrieve해 행동 안내, 동시에 agent-managed skill pipeline이 unlabeled rollout에서 재사용 가능 skill을 발견·skill bank 형성. 결정 에이전트의 skill retrieval·action generation 학습과 skill bank의 추출·정제·갱신이 함께 진화. 6개 게임 환경에서 8B base 모델로 4개 frontier LLM baseline 대비 +25.1% reward 평균 향상, 멀티플레이어 social reasoning 게임에서도 경쟁력 유지.
- •Long-horizon 게임 환경에서 LLM의 일관된 의사결정 한계를 skill bank 공진화로 해결.
- •LLM 결정 에이전트 + skill bank 에이전트가 skill retrieve·discover·refine을 동시 진화.
- •Unlabeled rollout에서 재사용 가능 skill 자동 추출 — labeled 학습 없음.
- •8B base 모델로 frontier LLM 대비 +25.1% 평균 reward 향상 (6개 환경).
- •멀티플레이어 social reasoning 게임에서도 경쟁력 — 응용 범위 입증.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks
- 1.장기 작업 위한 AI 에이전트
- 2.LLM 기반 의사결정 개선
- 3.기술 은행 에이전트 협력
왜 중요한가?
이 연구는 장기적인 상호작용 환경에서 AI 에이전트가 복잡한 작업을 수행할 수 있도록 LLM의 의사결정 능력과 다양한 기술 활용 능력을 통합하여 AI의 자율성과 효율성을 크게 향상시킵니다.
본문 미리보기
arXiv:2604.20987v1 Announce Type: new Abstract: Long horizon interactive environments are a testbed for evaluating agents skill usage abilities. These environments demand multi step reasoning, the chaining of multiple skills over many timesteps, and robust decision making under delayed rewards and partial observability. Games are a good testbed for evaluating agent skill usage in environments. Large Language Models (LLMs) offer a promising alternative as game playing agents, but they often stru
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:29AI 초안

