카네기멜런·NYU·스탠퍼드·MIT 연구팀이 네이처에 발표한 AI '아타락소스'가 역대 최다 우승 스트라테고 선수 핌 니메이예르를 20전 15승1패4무로 완파했다. 딥마인드가 1024개 TPU로 2~3개월(추정 300만~450만달러) 학습시킨 딥내시가 2023년 세계선수권에서 상위권 선수들에게 패했던 반면, 아타락소스는 16개 H100 GPU로 일주일(약 8000달러)만 학습해 비용은 약 500분의 1, 자가대전 게임 수는 30분의 1에 불과했다. 연구팀은 설정을 다양화하도록 강제하는 정규화 기법과, 상대의 숨은 패를 예측하는 '신념망'을 결합해 10^33개에 달하는 은닉정보 공간을 다뤘다고 설명했다. 연구팀은 이 방법이 하나비, 더우디주 등 다른 불완전정보 게임에서도 기존 최고 성능을 능가했다며, 금융시장·군사충돌·협상 등 불완전정보가 있는 실제 전략적 의사결정 문제에도 적용 가능성이 있다고 밝혔다.
- •AI '아타락소스', 역대 최다 우승 스트라테고 선수를 20전 15승1패4무로 완파
- •딥마인드 딥내시의 500분의 1 비용(약 8000달러), 30분의 1 자가대전으로 학습
- •설정 다양화를 강제하는 정규화 기법과 상대 패를 추론하는 '신념망' 결합
- •하나비·더우디주 등 다른 불완전정보 게임에서도 기존 최고 성능 능가
- •연구팀, 금융시장·군사충돌·협상 등 실제 전략적 의사결정에도 적용 가능성 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AI beats Stratego's greatest player, ending one of the last human strongholds in board games

- 1.CMU·NYU·스탠퍼드·MIT, 최다우승자 니메이어 완파한 Stratego AI 'Ataraxos' 공개(20전 15승1패4무)
- 2.학습비용 8000달러 미만(H100 16기 1주+벨리프망 4일), DeepMind DeepNash 추정비용의 1/500 수준
- 3.Barrage Stratego·Hanabi·Dou dizhu 등에서도 신기록, 히든정보 게임에 RL·탐색이 통함을 입증
- 4.핵심은 self-play 중 다양성을 높이는 정규화와 상대 패를 추정하는 belief network
왜 중요한가?
불완전정보 보드게임인 Stratego는 DeepMind도 넘지 못한 AI의 마지막 난제였는데 저비용으로 돌파했다는 점에서, 금융시장·협상·군사 시뮬레이션 등 불완전정보 의사결정 문제 전반에 적용 가능성을 시사한다.
본문 미리보기
The AI system Ataraxos has decisively beaten the best Stratego player of all time. The board game is a tough test for AI because both sides set up their pieces face down. Google Deepmind fell short in 2023 despite a multimillion-dollar budget. Researchers from Carnegie Mellon, NYU, Stanford, and MIT built Ataraxos for less than $8,000. The article AI beats Stratego's greatest player, ending one of the last human strongholds in board games appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안

