포커(무레인지 리밋 홀덤) 자기회귀 모델에서 은닉 상태 프로브가 상대 핸드 정보를 복원하는 것이 실제 '신념 추적'의 증거인지 검증한 연구다. 행동·가치 타깃만으로 학습한 모델에서 상대 레인지 프로브는 3개 시드 중 2개에서 양성이었지만, 가시적인 공개 베팅 구성(composition)이 잔여 은닉 상태보다 더 많은 레인지 신호를 설명했다. 행동/가치+구성 베이스라인이 top-10 정확도 16.5~16.7%인 반면 구성 잔차 은닉 프로브는 11.4~12.2%에 그쳤고, 구성 매칭 비교는 모든 시드에서 음성이었다. 연구진은 이를 '구성 한정 예측 지지'로 명명하며, 합성 통제·오라클 검증으로 진단법 자체의 타당성도 확인했다. 프로브 양성 결과를 신념 추적의 증거로 해석하기 전에 표적화된 대안 가설을 검증해야 한다는 해석가능성 연구 방법론적 경고다.
- •포커 자기회귀 모델의 은닉 상태 프로브 양성이 신념 추적 증거인지 검증한 케이스 스터디
- •가시적 베팅 구성이 잔여 은닉 상태보다 상대 레인지 신호를 더 많이 설명
- •구성 베이스라인 top-10 16.5~16.7% vs 구성 잔차 프로브 11.4~12.2%, 매칭 비교는 전 시드 음성
- •'구성 한정 예측 지지' 개념 제안—프로브 양성을 신념 추적으로 해석하기 전 대안 가설 검증 필요
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Tracking or Shortcut: Composition-Bounded Predictive States in Poker Autoregressive Models
- 1.포커 자기회귀 모델의 은닉 상태가 상대 핸드 '믿음 추적'을 한다는 해석에 반박 증거 제시
- 2.상대 레인지 신호 대부분이 은닉 상태가 아닌 공개 베팅 구성(composition)으로 설명됨
- 3.구성 통제 후 은닉 프로브 top-10 정확도 11.4~12.2%로 하락, 매칭 비교는 전 시드 음성
- 4.합성 통제 실험으로 진짜 사후믿음 상태는 통과, 원시 구성 상태는 기각됨을 검증
왜 중요한가?
프로브가 잠재 정보를 복원한다는 결과가 곧 모델의 '믿음 표상' 증거는 아니라는 점을 보여줘, 해석가능성 연구에서 흔한 프로빙 기반 주장에 대조 기준선 통제가 필수임을 시사한다. LLM 세계모델·믿음 추적 논쟁에 방법론적 경고를 던지는 사례 연구다.
본문 미리보기
arXiv:2607.19369v1 Announce Type: new Abstract: Hidden-state probes often recover latent labels in imperfect-information sequence models, but this alone does not establish that a model maintains a posterior belief distribution over hidden states. This paper studies this ambiguity in a no-range Limit Hold'em autoregressive model trained only on action and value targets, not on an opponent's hand or range. Opponent-range probes are positive after action/value controls in two of three seeds, and t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

