도구를 사용하는 LLM 에이전트가 여러 차례 대화(멀티턴)로 위험한 목표를 잘게 쪼개 숨기는 '분산 위험' 공격에 취약하다는 문제를 다룬다. 연구진은 각 행동을 생성하기 전 지금까지의 대화 궤적을 압축한 안전 표현을 모델에 주입하는 생성 시점 방어 기법 ReDiR을 제안했다. 이 표현은 안전한 과제 수행 경로의 감독 신호를 활용해, 별도의 행동 단위 안전 모듈 없이도 멀티턴 전반의 보안 증거를 통합한다. 세 모델군과 8개 미학습 도구 영역에 걸친 두 개 에이전트 안전 벤치마크에서 ReDiR은 공격 성공률을 8% 미만으로 낮추면서도 정상 작업 성능과 낮은 연산 오버헤드를 유지했다. 별도 온라인 추론 모듈 없이 생성 과정 자체에 안전성을 내재화할 수 있음을 보여준다.
- •멀티턴 분해 공격: 개별 요청은 무해해 보이지만 누적되면 위험한 목표가 드러남
- •ReDiR은 행동 생성 전 대화 궤적을 압축한 '잠재 안전 표현'을 고정된 기반 모델에 주입
- •동일 모델 내 교차 관점 지도학습으로 안전 증거를 학습(별도 모듈 불필요)
- •3개 모델군, 8개 미학습 도구 영역에서 공격 성공률 8% 미만으로 감소
- •미학습 도구 영역에도 전이되며 정상 작업 성능과 연산 효율을 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety
- 1.다중턴에 걸쳐 분산된 공격을 방어하는 생성 단계 방어기법 ReDiR 제시
- 2.행동 생성 전 궤적 전체를 압축한 잠재 안전표현을 프로즌 모델에 주입하는 방식
- 3.같은 모델 내 명시적 과제 뷰로부터 크로스뷰 지도학습을 수행, 별도 안전모듈 불필요
- 4.2개 벤치마크·3개 모델군·8개 미학습 툴 도메인에서 공격 성공률을 8% 미만으로 낮춤
왜 중요한가?
여러 차례에 걸쳐 위장된 악성 목표를 개별 요청 검사로는 잡지 못하던 한계를 궤적 단위 방어로 해결해, 툴 사용 에이전트의 실질적 안전성을 높인다.
언급 프로젝트
LLM 에이전트가 외부 시스템과 연동하는 '도구'를 사용함에 따라 보안 위험이 생성 텍스트를 넘어 실제 행동으로 확장되는 상황입니다. 이 연구는 여러 단계에 걸쳐 분산된 악의적 목표를 재구성하고 에이전트의 안전한 행동 생성을 위한 경로 조건화를 제시하여, 국내 기업들이 LLM 에이전트를 실제 업무에 도입할 때 발생할 수 있는 잠재적 위험을 선제적으로 관리할 수 있는 중요한 통찰을 제공합니다.
본문 미리보기
arXiv:2608.25711v1 Announce Type: new Abstract: Tool-using LLM agents extend security risks beyond generated text to actions that affect external systems. Under multi-turn decomposition attacks, a harmful objective can be distributed across individually plausible requests and tool calls, becoming apparent only from the accumulated trajectory. Existing defenses either rely on auxiliary online reasoning to recover long-horizon security evidence or assess actions after generation, often incurring
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
