Mahjax는 JAX로 구현된 완전 벡터화 리치 마작 환경으로 GPU 대규모 병렬 시뮬레이션을 지원한다. 8개 NVIDIA A100 GPU에서 초당 최대 200만 스텝의 처리량을 달성하여 대규모 강화학습 연구를 가능하게 한다. AlphaZero 계열처럼 인간 플레이 로그 없이 처음부터 학습하는 타불라 라사 알고리즘 연구를 지원한다. 시각화 도구도 함께 제공하며, 에이전트가 기준 정책 대비 랭킹을 향상시킬 수 있음을 실험적으로 검증했다.
- •JAX 기반 완전 벡터화로 8개 A100 GPU에서 초당 최대 200만 스텝 소쫐을 달성한게 군제 에필 환경이다.
- •인간 플레이 로그 없이 처음부터 학습하는 타불라 라사(tabula rasa) 알고리즘을 위한 연구 기반을 제공한다.
- •리치 마작의 다인용자, 불완전 정보, 고차원 상태 공간 속성이 복잡한 실세계 의사결정 문제와 유사한 구조를 모사한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX
- 1.JAX로 구현된 완전 벡터화 리치 마작 강화학습 환경 Mahjax 소개
- 2.8개 NVIDIA A100 GPU에서 초당 최대 200만 스텝 처리량 달성
- 3.처음부터 학습(tabula rasa)이 가능해 AlphaZero 계열 연구에 활용 가능
왜 중요한가?
다중 플레이어 불완전 정보 게임 환경에서 대규모 RL 연구를 가능하게 하는 고성능 시뮬레이터로, 복잡한 의사결정 AI 연구에 기여한다.
언급 프로젝트
본문 미리보기
arXiv:2605.20577v1 Announce Type: new Abstract: Riichi Mahjong is a multi-player, imperfect-information game characterized by stochasticity and high-dimensional state spaces. These attributes present a unique combination of challenges that mirror complex real-world decision-making problems in reinforcement learning. While prior research has heavily relied on supervised learning from human play logs to pre-train the policy, algorithms capable of learning \textit{tabula rasa} (from scratch) offer
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

