LLM 에이전트의 다단계 실행 궤적은 길고 비정형적이어서 안전 감사와 실시간 모니터링이 어렵다. 연구진은 전체 궤적 데이터셋을 하나의 소형 유한상태기계(FSM)로 압축해 실행 간 공유되는 행동 구조를 복원하는 방법을 제안했다. 공개 데이터셋 12종에서 FSM은 7~43개 상태로 압축되면서도 held-out 데이터를 0.997 이상의 적합도로 재현했고 밀리초 단위로 구축됐다. 다음 단계 예측에서는 모든 데이터셋에서 Agent Workflow Memory를 능가했고, 실패 예측에서는 상태별 행동 특징으로 held-out AUROC 0.94를 달성해 부분 궤적만으로도 실패 가능성이 높은 실행을 조기에 감지, 중단시킬 수 있었다.
- •에이전트 실행 교적 전체를 하나의 소형 유한상태기계(FSM)로 압축
- •12개 공개 데이터셋에서 FSM이 7~43개 상태로 held-out 적합도 0.997 이상 재현
- •다음 단계 예측에서 Agent Workflow Memory를 모든 데이터셋에서 능가
- •실패 예측 AUROC 0.94, 부분 교적만으로도 실패 예측 및 조기 중단 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Automata from Agent Traces: Failure and Next-Step Prediction
- 1.LLM 에이전트 실행 트레이스를 7~43개 상태의 소형 유한상태기계(FSM)로 압축, 12개 데이터셋서 재현율 0.997 이상
- 2.다음 단계 예측에서 FSM 기반 컨텍스트가 모든 데이터셋에서 Agent Workflow Memory를 능가
- 3.실패 예측에서 상태별 특징으로 held-out AUROC 최대 0.94, 부분 트레이스만으로 실패 조기 감지·중단 가능
- 4.에이전트 행동 구조는 LLM 자체보다 배포 하네스(실행 환경)가 더 크게 좌우한다는 결과 확인
왜 중요한가?
긴 비정형 트레이스 탓에 어렵던 에이전트 안전 감사·런타임 모니터링을 밀리초 단위 경량 FSM으로 실현 가능하게 해, 프로덕션 에이전트 배포 신뢰성 확보에 실질적 도구를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2608.23670v1 Announce Type: new Abstract: LLM-based agents execute multi-step tasks, but their behavioral structure remains opaque: long unstructured traces resist the safety auditing and runtime monitoring that deployment requires. Existing approaches operate per-trace or success-only, so they miss the cross-run topology that links next-step and failure prediction. To recover that shared structure, we collapse an entire trace corpus into a single, compact finite-state machine (FSM) that
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
