NEXUS: Structured Runtime Safety for Tool-Using LLM Agents
- 1.도구 사용 LLM 에이전트의 런타임 안전 모니터 NEXUS 공개, 허용·차단·확인·수정 4단계 개입 정책
- 2.결정론적 규칙+인자 검사+로지스틱 회귀 위험 점수를 결합한 단계적 에스컬레이션
- 3.합성 벤치마크 F1 0.949, 4분류 개입 정확도에서 규칙 단독 대비 27.3%p 우위
- 4.중앙값 지연 0.205ms로 에이전트 루프 오버헤드 0.1% 미만, 코드·벤치마크 공개
왜 중요한가?
에이전트가 고위험 실행 권한을 갖는 추세에서, 이진 허용/차단이 아닌 확인·수정 요청까지 포함한 세분화된 개입 정책을 0.1% 미만 오버헤드로 구현했다는 점이 실전 배포 관점에서 의미 있다. IPI 공격 성공률 0% 결과는 프롬프트 주입 방어 계층으로서의 가능성을 보여준다.
🏷️ 언급 프로젝트
본문 미리보기
arXiv:2607.19356v1 Announce Type: new Abstract: Tool-using LLM agents increasingly execute high-impact actions, making runtime safety monitoring essential. We present NEXUS (Neural EXecution Utility and Safety), a structured-plan safety monitor that applies a formal intervention policy to select among four actions: allow, block, request confirmation, or request revision. NEXUS combines deterministic safety rules, argument-level inspection, and a calibrated logistic-regression risk score for gra
전체 내용이 궁금하다면?
원문을 직접 읽어보세요