NEXUS는 도구를 사용하는 LLM 에이전트의 고위험 행동을 실행 시점에 감시해 허용·차단·확인 요청·수정 요청 4가지 개입을 선택하는 구조화된 런타임 안전 모니터다. 결정론적 안전 규칙, 인자 수준 검사, 보정된 로지스틱 회귀 위험 점수를 결합해 단계적 개입을 수행한다. 128개 합성 벤치마크에서 F1 0.949와 4클래스 개입 정확도 0.6406을 기록해 규칙만 쓴 방식을 27.3%p 앞섰고, R-Judge에서도 F1 0.861로 우위를 보였으며 IPI 공격에서는 정상 요청 99% 허용 조건에서 공격 성공률 0%를 달성했다. 중위 지연시간 0.205ms로 에이전트 루프 오버헤드가 0.1% 미만이라 실배포에 부담이 적으며, 코드·벤치마크·위험 점수기가 공개됐다.
- •허용·차단·확인요청·수정요청 4단계 개입 정책을 적용하는 LLM 에이전트 런타임 안전 모니터
- •결정론적 규칙 + 인자 수준 검사 + 보정된 로지스틱 회귀 위험 점수의 3중 결합 구조
- •합성 벤치마크 F1 0.949, 4클래스 개입 정확도 0.6406으로 규칙 기반 대비 27.3%p 우위
- •IPI 공격에서 정상 요청 99% 허용 유지하며 공격 성공률(ASR) 0% 달성
- •중위 지연 0.205ms, 오버헤드 0.1% 미만이며 코드와 벤치마크 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
NEXUS: Structured Runtime Safety for Tool-Using LLM Agents
- 1.도구 사용 LLM 에이전트의 런타임 안전 모니터 NEXUS 공개, 허용·차단·확인·수정 4단계 개입 정책
- 2.결정론적 규칙+인자 검사+로지스틱 회귀 위험 점수를 결합한 단계적 에스컬레이션
- 3.합성 벤치마크 F1 0.949, 4분류 개입 정확도에서 규칙 단독 대비 27.3%p 우위
- 4.중앙값 지연 0.205ms로 에이전트 루프 오버헤드 0.1% 미만, 코드·벤치마크 공개
왜 중요한가?
에이전트가 고위험 실행 권한을 갖는 추세에서, 이진 허용/차단이 아닌 확인·수정 요청까지 포함한 세분화된 개입 정책을 0.1% 미만 오버헤드로 구현했다는 점이 실전 배포 관점에서 의미 있다. IPI 공격 성공률 0% 결과는 프롬프트 주입 방어 계층으로서의 가능성을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2607.19356v1 Announce Type: new Abstract: Tool-using LLM agents increasingly execute high-impact actions, making runtime safety monitoring essential. We present NEXUS (Neural EXecution Utility and Safety), a structured-plan safety monitor that applies a formal intervention policy to select among four actions: allow, block, request confirmation, or request revision. NEXUS combines deterministic safety rules, argument-level inspection, and a calibrated logistic-regression risk score for gra
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

