LLM 기반 에이전트의 안전 판단 능력을 향상시키기 위한 ROME과 ARISE를 소개한다. ROME은 알려진 안전하지 않은 궤적을 더 기만적인 평가 인스턴스로 재작성해 300개의 도전 인스턴스를 생성하며, ARISE는 유추 추론을 활용해 재훈련 없이 안전 판단 품질을 향상시킨다. 실험 결과, 기만적 시나리오에서 최신 프론티어 모델도 안전 판단 성능이 크게 저하됨을 확인했으며, 두 도구가 배포 외 분포 변화 하에서 에이전트 안전성을 스트레스 테스트하고 개선하는 실용적 수단을 제공한다.
- •ROME은 100개의 안전하지 않은 궤적에서 맥락적 모호성, 암묵적 위험, 단축키 의사결정을 포함한 300개 도전 인스턴스를 생성한다.
- •숨겨진 위험 케이스는 최신 프론티어 모델에게도 여전히 비자명한 도전 과제로 남아 있다.
- •ARISE는 외부 유추 기반에서 ReAct 스타일 안전 궤적을 검색해 추론 시 구조화된 예시로 주입한다.
- •ARISE는 재훈련 없이 판단 품질을 개선하지만, 독립적인 안전 보장보다는 특정 작업 강건성 향상 도구로 봐야 한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Enhancing Agent Safety Judgment: Controlled Benchmark Rewriting and Analogical Reasoning for Deceptive Out-of-Distribution Scenarios
본문 미리보기
arXiv:2605.03242v1 Announce Type: new Abstract: Tool-using agent systems powered by large language models (LLMs) are increasingly deployed across web, app, operating-system, and transactional environments. Yet existing safety benchmarks still emphasize explicit risks, potentially overstating a model's ability to judge deceptive or ambiguous trajectories. To address this gap, we introduce ROME (Red-team Orchestrated Multi-agent Evolution), a controlled benchmark-construction pipeline that rewrit
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

