연구진은 LLM 에이전트가 주입된 악성 지시나 잘못된 정보 같은 안전 위험에 취약하다는 점에 착안해, 다양한 위험 전반에서 실행 중 위험 행동을 막으면서도 정상 작업 효율을 해치지 않는 런타임 방어 체계를 제안했다. 트리거, 모니터, 피드백 세 모듈로 구성된 위험인지형 하네스는 LLM 기반 모니터링으로 유연하게 위험을 탐지하고 표적화된 안전 개입을 수행한다. 이를 다양한 위험과 배포 환경에 맞추기 위해 HARDE라는 2단계 하네스 최적화 프레임워크를 도입해, 먼저 각 모듈을 독립적으로 탐침해 최적화 가이드를 만들고 이를 바탕으로 안전성과 효용 피드백에 따라 반복적으로 하네스를 최적화한다. 세 가지 공격 벤치마크 실험에서 HARDE는 수작업 설계 하네스와 단순 최적화 기준선보다 안전성을 높이면서도 효용은 유지하는 것으로 나타났다.
- •트리거, 모니타, 피드백 세 모듈로 구성된 위험인지형 런타임 방어 하니스를 제안했다
- •HARDE는 각 모듈을 독립적으로 탐진한 후 안전성과 효용 피뚨백을 기반으로 반무 최적화하는 2단가즸 틀뚈임워크다
- •세 가지 공객 벤엘즈밐괼즈크에서 수작업 설강 따 단순 최적현 기줄선뿐다 안전성이 향상됐다
- •정상 작업의 효용 저해를 최소화한 표적화된 안전 거입을 수행한다
- •모니타 역놩에 개맞춘 하니스 설개와 거지인지혁 최적화가 방어의 핵신 요소다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
HARDE: Optimizing Agent Harnesses for Runtime Risk Detection and Execution Control
- 1.LLM 에이전트 런타임 안전을 위한 trigger-monitor-feedback 구조의 위험인지형 하네스 제안
- 2.HARDE는 모듈별 독립 프로빙으로 최적화 가이드를 만든 뒤 피드백으로 하네스를 반복 최적화
- 3.세 공격 벤치마크에서 수작업 하네스·단순 최적화 대비 안전성과 유용성을 동시에 개선
- 4.깃허브에 코드를 공개해 재현 가능성 확보
왜 중요한가?
프롬프트 인젝션 같은 위험을 사전 탐지에 그치지 않고 실행 단계에서 선제 차단하면서도 정상 작업 수행력은 유지해, 실제 에이전트 배포에 바로 적용 가능한 런타임 방어 설계를 제시한다.
언급 프로젝트
대규모 언어 모델(LLM) 에이전트의 오남용 위험은 전 세계적으로 중요한 안전 문제로 부상하고 있습니다. 이 연구는 런타임에서 안전 문제를 탐지하고 제어하는 기술의 중요성을 강조하며, 이는 LLM 활용이 급증하는 국내에서도 신뢰할 수 있는 AI 시스템 구축을 위한 필수적인 논의가 될 것입니다.
본문 미리보기
arXiv:2609.38291v1 Announce Type: new Abstract: Large language model (LLM) agents are vulnerable to safety risks such as injected malicious instructions or misleading information, motivating runtime defenses that prevent unsafe action in execution across diverse risks while preserving benign-task utility. Existing system-level defenses either focus on risk detection rather than timely prevention or rely on predefined rules with limited flexibility across diverse risks. We propose a risk-aware h
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

