이 논문은 장기 자율 에이전트가 자신의 상태와 자기 보고를 신뢰할 수 없는 상황에서 어떻게 검증할 수 있는가라는 문제를 다룬다. 저자는 결정론적 '이그제큐티브'가 모든 신념을 소유하고 LLM은 유형화된 제안만 제출하며, 행동 전 사전 등록된 예측이 코드에 의해 관찰과 대조될 때만 주장을 인정하는 구조적 검증 도구를 제시했다. 한계 위반 시 실행 자체가 무효화되도록 설계했고(첫 8개 실행 중 4개가 무효화되어 각기 실제 결함을 특정), 커밋먼트 메커니즘을 제거하자 목표 포기율이 0.00에서 1.00으로 치솟은 반면 바인딩 오류는 그대로였다. ARC-AGI-3에서 52개 검증된 실행 전체에 걸쳐 과제 완수율이 0이었음을 투명하게 공개했으며, 핵심 기여는 과제 성능이 아니라 드리프트를 측정 가능하게 만드는 검증 방법론 자체에 있다.
- •결정론적 '이그제큐티브'가 신념을 소유하고 LLM은 제안만 하는 자기검증형 에이전트 구조 제시
- •사전 등록 예측을 코드가 관찰과 대조해야만 주장을 인정하는 구조적(사후 아님) 검증 방식
- •8개 아키텍처 실행 중 4개가 무효화되며 각기 실제 결함을 특정
- •커미트먼트 메커니즘 제거 시 목표 포기율 0→1.00 급증, 바인딩 오류는 변화 없음
- •ARC-AGI-3에서 과제 완수율 0(전 52회)을 사전 등록된 구조적 반증으로 투명하게 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents
본문 미리보기
arXiv:2608.04066v1 Announce Type: new Abstract: How do you verify a long-horizon agent when its own state and self-reports are exactly what you cannot trust? We present an agent instrument built so that verification is structural rather than post-hoc. A deterministic Executive owns all belief; a language model may only file typed proposals, and a claim is admitted only when a prediction pre-registered before acting is matched against observation by code. Two properties make the instrument a ver
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

