모델의 은닉 상태 신호는 디코딩되거나 인과적으로 활용 가능하더라도 재사용 가능한 "행동 지도(action map)"를 뒷받침하지 못할 수 있다. 이 논문은 알려진 아핀 S_5 캐리어에서 소스 없이 학습된 행동 지도가 실제 행동 후 활성화 지점에 도달하고 합성되는지를 증거 격자 형태로 검증했다. 구조적 곡률과 도메인 간 켤레 조건은 오차를 단조적으로 높였지만 30개 강한 셀 중 23개만 폐쇄 게이트를 통과해, 이 성질이 보편적이지 않고 제한적으로만 성립함을 보였다. Qwen3-4B의 동결된 최종 토큰 h28 아핀 지도는 held-entity 오차가 .519로 도메인 내 교차 학습(.398)보다 나빴고, 개입 실험에서 인과 효과는 h28/h36에서만 관찰됐다. 결과는 상태 가용성, 인과적 활용, 국소 기하학, 재사용 가능한 폐쇄성이 서로 분리 가능한 속성임을 시사하며, 단일 사전학습 모델과 제한된 조건에서만 검증됐다는 한계가 있다.
- •은닉 상태의 디코딩 가능성·인과적 활용성과 재사용 가능한 행동 지도 구성 가능성을 구분해 검증.
- •Qwen3-4B h28 아핀 지도의 held-entity 오차(.519)가 도메인 내 교차학습(.398)보다 높았음.
- •30개 강력 셀 중 23개만 폐쇄 게이트를 통과해 보편적 성립이 아니라 제한적임을 확인.
- •인과 효과는 h28/h36 층에서만 관찰되어 상태 가용성과 재사용성이 별개 속성임을 시사.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Calibrated Test of Internal Action Maps: State Signals Without Global Affine Closure
- 1.은닉상태가 정보를 디코딩·인과활용 가능해도 재사용 가능한 '행동지도'로 일반화되지 않음을 실험 확인
- 2.큐웬3-4B 특정레이어 고정매핑, 새 개체 대상 오차 .519로 도메인내 교차검증(.398)보다 저조
- 3.개입실험서 인과효과는 h28·h36 레이어에서만 나타나 재사용 가능한 내부 세계모델 부재 시사
왜 중요한가?
모델 내부 정보가 디코딩 가능하다는 것과 재사용 가능한 일반 지도로 작동한다는 것은 별개임을 실증해, 해석가능성 연구에 방법론적 경계를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.13626v1 Announce Type: new Abstract: A hidden state signal can be decodable or causally usable without supporting a reusable action map. We test whether action maps fitted without a source reach its natural post-action activation and compose. We organize the tests as an evidence lattice and validate the geometric branch on a known affine S_5 carrier: all held-source folds pass one-step, composition, inverse, decoding, and commutativity gates. Structured curvature and held-domain conj
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

