이 논문은 LLM 에이전트 워크플로우에서 어떤 설치된 스킬이 사용자 요청을 처리할지 결정하는 스킬 선택 단계에 대해, 기존의 명시적 프롬프트 인젝션이나 지시 수준 조작과 달리 사용자 프롬프트와 스킬 설명이 각각 무해해 보여도 그 의미적 관계를 전략적으로 형성해 공격자가 원하는 스킬을 선택하게 만드는 새로운 암묵적 공격 표면을 밝힌다. 연구진은 대상 스킬의 메타데이터와 재사용 가능한 프롬프트를 함께 조형해 명시적 선택 지시 없이 스킬 선택을 조작하는 ISM을 제안하며, 의미 커버리지 확장·표적 차별성 강화·자연스러운 프롬프트 어투 유지의 3단계 전략을 개발했다. 4개 과제 영역과 8개 선택 모델에 걸쳐 ISM은 평균 표적 선택률을 15.2%에서 63.5%로 끌어올렸고, 매칭 비교에서는 73.5%의 표적 선택률로 명시적 조작보다 불과 9.8%p 낮았다. 사람 검토자는 ISM을 2.9%의 경우에만 차단한 반면 명시적 조작은 91.4%를 차단했고, 5개의 LLM 기반 검사기는 ISM을 평균 82.9% 통과시켰다. ISM은 기존 방어 기법에도 여전히 효과적이었다.
- •스킬 선택 단계에서 프롬프트·스킬 설명 간 의미적 관계를 조형하는 새로운 암묵적 공격 표면 ISM을 제시했다.
- •메타데이터·재사용 프롬프트를 3단계 전략으로 조형해 명시적 지시 없이 표적 스킬 선택을 유도한다.
- •4개 과제, 8개 선택 모델에서 평균 표적 선택률을 15.2%→63.5%로 끬어올렸다.
- •사람 검토자는 ISM을 2.9%만 차단해 명시적 조작(91.4% 차단)보다 훨씬 탐지하기 어려웠다.
- •PPL-W, Llama Prompt Guard 2, PIGuard 등 기존 방어 기법에도 여전히 효과적이었다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Implicit Manipulation for Skill Selection in LLM Agents with Semantic Matching
- 1.LLM 에이전트 스킬선택 단계에서 개별적으로 무해해 보이는 프롬프트·설명의 의미관계를 조작해 특정 스킬 유도하는 암묵적 공격면 발견
- 2.ISM 제안: 타겟 스킬 메타데이터와 재사용 프롬프트를 함께 조정해 명시적 지시 없이 선택 조작
- 3.4개 과제·8개 선택모델에서 평균 목표선택률 15.2%→63.5%로 상승, 명시적 유도 대비 9.8%p만 낮은 73.5% 달성
- 4.인간검토자는 ISM을 2.9%만 차단(명시적은 91.4%), LLM 검사기는 ISM을 82.9% 통과(명시적은 37.4%)
왜 중요한가?
눈에 띄는 조작 신호 없이도 사람과 자동 탐지기 모두를 우회해 에이전트가 공격자가 원하는 스킬을 선택하게 만들 수 있어, 기존 프롬프트 인젝션 방어체계가 놓치는 새로운 공급망형 취약점을 드러낸다.
LLM 에이전트의 활용이 국내에서도 확대됨에 따라, 에이전트 보안 취약점 연구는 매우 중요합니다. 이 논문은 기존의 명시적 공격을 넘어선 새로운 위협 요소를 제시하며, 국내 AI 에이전트 개발 기업들이 보안 설계를 강화하는 데 필수적인 통찰을 제공합니다. 이는 안전하고 신뢰할 수 있는 AI 서비스 구현에 기여할 것입니다.
본문 미리보기
arXiv:2609.02035v1 Announce Type: new Abstract: Skill selection is a key stage in LLM-agent workflows, determining which installed skill should handle a user request. Existing attacks on this stage primarily rely on explicit prompt injection or instruction-level steering, which can expose recognizable manipulation signals. In this work, we identify a new implicit attack surface for skill selection: even when the user prompt and skill description appear benign in isolation, their semantic relati
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
