GENSTRAT는 절차적으로 생성된 2인 제로섬 불완전 정보 카드 게임 분포를 사용해 LLM의 전략적 추론 역량을 평가하는 벤치마크로, 지속적 평가와 오염 저항성을 제공한다. 2,000개 생성 풀에서 추출한 50개 게임으로 9개 프론티어·오픈 가중치 LLM을 36,000회 이상 매치로 평가한 결과, 최상위 3개 모델 중 gpt-5와 claude가 gemini-3.1-pro보다 현저히 높은 로컬 변동성(jaggedness)을 보였다. 능력 프로파일을 상태 공간·시간적 깊이·정보 민감도·상대 모델링·위험·취약성의 6축으로 분해해, 종합 순위가 같아도 배포 환경에서 다른 행동을 보임을 밝혔다. 경제 에이전트로서 LLM의 배포 관련 진단에 종합 순위 이상의 정보를 제공한다.
- •절차 생성 2인 제로섬 불완전 정보 카드 게임으로 지속 가능하고 오염 저항적인 evergreen 평가 구현
- •9개 LLM 36,000회+ 매치 토너먼트; 상위 3개 중 gpt-5·claude가 gemini-3.1-pro보다 훨씬 높은 jaggedness
- •6축 능력 프로파일: 상태 공간·시간 깊이·정보 민감도·상대 모델링·위험·취약성으로 역량 분해
- •jaggedness 지수: 전략적으로 유사한 게임 사이 모델 우위의 예측 불가 도약 감지 지표
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models
- 1.GENSTRAT는 절차적 생성 2인 제로세 불완전 카드 게임으로 LLM 전략 추론을 상시 평가하는 프레임워크
- 2.역량 프로파일이 6개 축(상태 공간, 시간 깊이, 정보 민감도, 상대 모델링, 리스크, 취약성)으로 모델 역량을 분해
- 3.36,000회 이상 매치에서 gpt-5·claude는 gemini-3.1-pro보다 유사 게임 간 jaggedness가 현저히 높음
왜 중요한가?
고정 게임 벤치마크의 포화·오염 문제를 상시 재생성 환경으로 해결하며, 순위 외 단면으로 전략 추론 능력을 진단해 LLM을 경제 에이전트로 배포 시 예측 불가 리스크를 정량화할 수 있다.
언급 프로젝트
본문 미리보기
arXiv:2605.23238v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly deployed as economic agents in marketplaces, auctions, and bidding settings. Anticipating their behavior in any specific deployment is hard. Existing strategic-reasoning benchmarks evaluate models on fixed canonical games. These benchmarks may saturate as the frontier improves, and they do not allow evaluators to generalize with confidence from benchmark performance to the varied and messy strategic en
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

