현대 비전-언어모델(VLM)은 경쟁·협력 상황에서 불확실성 하에 타 에이전트의 행동을 예측·영향하는 전략적 추론에 자주 어려움을 겪는다. 실시간 전략(RTS) 게임은 아군 협조·적 전략 적응·부분관측 하 장기 계획을 요구해 이 한계를 진단하는 자연스러운 테스트베드지만, 기존 RTS 벤치마크는 평가 범위가 좁고 체계적 역량 진단이 없으며 사전 설계 시나리오에 고정돼 있다. RTSGameBench는 더 넓은 전략 다양성을 요구하는 대규모 RTS 게임 Beyond All Reason 위에 구축돼, 다양한 매치업 게임플레이 평가, 개별 전략 역량을 겨냥한 미니게임 진단, 자유형 질의를 새 미니게임으로 변환해 주기마다 개선되는 자기진화 생성 프레임워크로 확장 가능한 커버리지를 제공한다. 또한 FSM과 에이전트 메모리로 유닛을 관리하는 RTSGameAgent를 제공하며, 여러 SOTA VLM이 더 긴밀한 협조와 큰 과제 규모를 요구하는 매치업에서 부진함을 실증했다.
- •대규모 RTS 게임 Beyond All Reason 위에 구축해 넓은 전략 다양성 요구
- •미니게임 기반 개별 전략 역량 진단과 자기진화 생성으로 확장 가능한 커버리지
- •FSM과 에이전트 메모리로 유닛을 관리하는 RTSGameAgent 제공
- •SOTA VLM이 긴밀한 다중에이전트 협조·큰 과제 규모에서 부진함을 실증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models
- 1.RTSGameBench: 실시간 전략게임 'Beyond All Reason' 기반 VLM 전략추론 벤치마크 공개
- 2.개별 전략 역량을 진단하는 미니게임과 자가진화형 문제 생성 프레임워크 제공
- 3.대규모 RTS 운용을 위해 FSM·에이전트 메모리 기반 RTSGameAgent 함께 제시
- 4.최신 VLM들이 긴밀한 협응·다중에이전트 협력·대규모 태스크에서 부진함을 실증
왜 중요한가?
기존 RTS 벤치마크가 평가 범위와 역량 진단이 제한적이던 문제를, 확장 가능한 미니게임과 자가진화 생성으로 보완해 VLM의 불확실성 하 장기 전략추론 약점을 체계적으로 드러낸다.
한국은 스타크래프트와 같은 실시간 전략(RTS) 게임의 강국이자 e스포츠 종주국으로서, 전략적 추론 능력을 평가하는 이 벤치마크는 국내 게임 산업에 중요한 시사점을 줍니다. 비전-언어 모델(VLM)의 전략적 사고력 향상은 게임 AI의 발전을 넘어 국방 시뮬레이션 등 고도의 전략적 의사결정이 필요한 분야에까지 확장될 수 있어 주목할 필요가 있습니다.
본문 미리보기
arXiv:2606.18950v2 Announce Type: new Abstract: Modern Vision-Language Models (VLMs) often struggle with strategic reasoning, i.e., anticipating and influencing other agents' actions, under uncertainty in competitive and cooperative settings. Real-time strategy (RTS) games can be a natural testbed for diagnosing this limitation, as they demand coordination with allies, adaptation to opponents' strategy, and long-horizon planning under partial observability. However, existing RTS benchmarks offe
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안
