연구진은 LLM 에이전트의 안전을 위한 시스템 수준 방어 하니스가 전문가에 의해 한 번 설계된 뒤 다양한 모델과 도메인에 획일적으로 적용되는 한계를 지적하며, 특정 모델과 도메인에 맞춰 배포 가능한 하니스를 자동 합성하는 프레임워크 EvoSafeHarness를 제시했다. 자연어 정책과 실행 가능한 코드 로직을 함께 탐색하며, 모델 행동과 도메인 사양, 신선한 맥락의 적대적 검토로 벤치마크 특화 규칙을 배제하도록 안내한다. 4개 에이전트 벤치마크군에서 고정된 전문가 설계 방어보다 더 우수한 안전-유용성 경계를 달성했으며, DecodingTrust-Agent에서는 평균 공격 성공률을 45.6%에서 10.0%로 낮추면서도 유용성 손실은 3.3%포인트에 그쳤다. AgentDojo에서는 공격 성공률 0.0%에서 유용성 82.8%를 달성해 CaMeL의 두 배에 달하는 유용성을 보였으며, 처음 보는 AgentDyn 스위트에도 변경 없이 전이됐다.
- •모델·도메인별 맞춤 안전 하니스를 자동 합성하는 프레임워크 EvoSafeHarness 제안
- •자연어 정책과 실행 코드 로직을 함께 탐색, 적대적 검토로 벤치마크 특화 규칙 배제
- •DecodingTrust-Agent에서 공격 성공률 45.6%→10.0%, 유용성 손실 3.3%p에 그침
- •AgentDojo에서 공격 성공률 0.0%, 유용성 82.8%로 CaMeL 대비 2배 달성
- •처음 보는 AgentDyn 스위트에도 변경 없이 전이, Agent-SafetyBench에서도 최고 점수
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents
- 1.모델·도메인별 안전 하네스를 자동 합성하는 프레임워크 EvoSafeHarness 제안
- 2.자연어 정책과 실행코드를 함께 탐색, 벤치마크 특화 규칙은 적대적 재검토로 배제
- 3.DecodingTrust-Agent서 공격성공률 45.6%→10.0%, 효용손실 3.3점 그친
- 4.AgentDojo서 ASR 0%·효용 82.8% 달성, CaMeL 대비 2배 효용
왜 중요한가?
기존 전문가 설계형 안전 하네스는 모델·도메인마다 과잉 또는 과소 차단되는 문제가 있었는데, 배포 대상에 맞춰 자동 최적화된 하네스가 여러 벤치마크에서 안전성과 효용을 동시에 크게 개선함을 보여 실전 에이전트 보안 계층 설계에 실질적 대안을 제시한다.
본문 미리보기
arXiv:2609.05903v1 Announce Type: new Abstract: Large Language Model (LLM) agents are turning language into real-world effects, making safety necessary against both indirect prompt injections and direct harmful requests. System-level safety harnesses add an enforcement layer beyond model-level defenses, but existing harnesses are usually designed once by experts and applied across heterogeneous models and domains. Effective protection is deployment-dependent: models differ in how much enforceme
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

