SkillsMetric은 LLM 에이전트용 스킬 패키지의 보안성을 패턴밀도·통계이상·데이터흐름 테인트·임포트 이상·기능 불일치 다섯 차원으로 채점하는 정적분석 프레임워크다. 코드·시스템·의미 수준 16가지 공격유형을 포괄하는 2,266개 스킬 적대적 평가데이터셋을 구축하고 SkillMD-138K 전체 코퍼스에서 평가한 결과 AUC 0.93, 5중 교차검증 F1 73.4%±0.5%를 기록했으며 데이터 유출(93%)과 스테가노그래피 페이로드(93%) 탐지에 강했다. 하지만 일반 셸 명령을 이용한 호스트 파괴 공격은 5단계 모두를 회피해 탐지율 0%에 그쳤고, 자연어 조작을 통한 프롬프트 인젝션도 42% 탐지에 머물러 정적분석만으로는 스킬 보안을 담보할 수 없음을 드러냈다. 이에 저자들은 빠른 정적 사전선별과 의미론적 검토를 결합한 다중방어 아키텍처가 필요하다고 제안한다.
- •다섯 차원 점수로 스킬 패키지를 평가하는 SkillsMetric 정적분석 프레임워크 제안
- •2,266개 적대적 스킬 데이터셋으로 평가, AUC 0.93·F1 73.4% 달성
- •데이터 유출·스테가노그래피 탐지율은 93%로 양호
- •쉛 명령 기반 호스트 파괴 공격은 탐지율 0%, 프롬프트 인젝션은 42%로 사각지대 존재
- •정적분석만으로는 부족해 의미론적 검토와의 다중방어 가야함을 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills
본문 미리보기
arXiv:2608.08468v1 Announce Type: new Abstract: Agent Skills---structured packages of instructions and scripts that augment LLM-based agents---are rapidly proliferating, yet their security properties remain under-explored. We present \textsc{SkillsMetric}, a five-stage static analysis framework that scores skill packages along pattern density, statistical anomaly, dataflow taint, import anomaly, and capability mismatch dimensions. We construct an adversarial evaluation dataset of 2{,}266 skills
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안



