웹 브라우저, 코드 터미널 등 언어 환경에서 MDP 분석에 필요한 구조(상태 공간, 관측-상태 매핑, 인증된 전환, 종료 기준)가 없다는 문제를 해결하는 State-Centric Decision Process(SDP) 프레임워크를 소개합니다. 에이전트가 단계마다 자연어 서술어를 설정하고 행동으로 달성한 뒤 관측과 대조하여 인증된 상태를 구축합니다. 5개 벤치마크에서 훈련 없이 최고 성능을 달성하며 지평선이 길수록 우위가 확대되고, 인증된 궤적은 신용 할당·실패 위치 파악 등 고급 분석을 가능하게 합니다.
- •SDP는 언어 환경에서 MDP 구조를 에이전트가 런타임에 직접 서술어로 구축하는 프레임워크
- •자연어 서술어로 단계별 인증된 상태를 생성하여 결정론적 추적 가능
- •5개 벤치마크에서 훈련 없이 최고 성능, 장기 지평선에서 우위 확대
- •인증된 궤적으로 신용 할당·실패 위치 파악·부분 진행 측정 등 고급 분석 지원
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
State-Centric Decision Process
- 1.자연어 환경에서 에이전트가 상태 공간·전이·종료 기준을 자체 구성하는 SDP 프레임워크 제안
- 2.에이전트가 술어 단위로 목표 상태를 선언하고 관측을 검증해 인증된 궤적 생성
- 3.계획·과학 탐색·웹 추론·다단계 QA 5개 벤치마크에서 훈련 없이 최고 성능 달성
- 4.인증된 궤적으로 신용 할당·실패 위치 파악·모듈 교체 등 고급 분석 지원
왜 중요한가?
구조화되지 않은 자연어 환경에서 에이전트 의사결정의 투명성과 신뢰성을 높이는 런타임 프레임워크로, 실세계 AI 에이전트 배포의 안전성을 향상시킨다.
언급 프로젝트
본문 미리보기
arXiv:2605.12755v1 Announce Type: new Abstract: Language environments such as web browsers, code terminals, and interactive simulations emit raw text rather than states, and provide none of the runtime structure that MDP analysis requires. No explicit state space, no observation-to-state mapping, no certified transitions, and no termination criterion. We introduce the State-Centric Decision Process (SDP), a runtime framework that constructs these missing inputs by having the agent build them, p
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

