이 연구는 LLM 에이전트가 상태 없는 대화형 인터페이스에서 다단계 계획·도구 호출·코드 실행·영속적 메모리를 갖춘 자율 에이전트로 진화하면서, 잘못된 추론 한 단계가 무단 데이터 접근이나 되돌릴 수 없는 상태 변경, 연쇄 장애로 이어질 수 있다는 문제의식에서 출발한다. 저자들은 PRISMA 2020 지침에 따라 6개 데이터베이스에서 743편을 검토해 2023~2025년 발표된 85편의 에이전트형 LLM 보안 논문을 선별했다. 그 결과 공격 연구가 방어 연구보다 3.9대 1로 압도적으로 많았고, 프롬프트 인젝션·탈옥·적대적 섭동 등 인지 계층 취약점이 전체의 66%를 차지한 반면, 도구 오용·코드 인젝션·샌드박스 탈출 등 실제 위험이 큰 행동 계층 취약점 연구는 4.7%에 불과해 연구와 실제 위험 간 괴리가 드러났다. 논문은 인지·두뇌·행동·상호작용 4개 계층에 걸친 13가지 취약점 분류체계를 제시하고, 계층 간 약한 격리가 취약점을 전파시키는 '아키텍처 결합'을 핵심 문제로 지목했다.
- •2023~2025년 에이전트형 LLM 보안 논문 85편을 PRISMA 방법론으로 체계적 검토
- •공격 연구가 방어 연구보다 3.9배 많아 연구 불균형 확인
- •프롬프트 인젝션 등 인지 계층 연구가 66%인 반면 도구 오용 등 행동 계층은 4.7%에 그침
- •4개 계층 13개 취약점 분류체계 제시, 계층 간 약한 격리를 핵심 위험 요인으로 지목
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models
본문 미리보기
arXiv:2608.10530v1 Announce Type: new Abstract: Large Language Models (LLMs) have undergone a shift from stateless conversational interfaces to autonomous agents capable of multi-step planning, tool invocation, code execution, and maintaining persistent memory. When these agents operate with real-world privileges---calling APIs, modifying files, and querying databases---a compromised reasoning step can trigger unauthorized data access, irreversible state changes, or cascading failures, yet the
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안



