연구진이 파일이 숨겨진 폐쇄형 LLM 에이전트 스킬도 정상적인 사용만으로 기능이 복제될 수 있음을 보이는 행위적 스킬 재구성(BSR) 공격 SkillClone을 제안했다. 공개된 스킬 설명으로부터 인터페이스 가설을 세우고, 구조화된 정상 프로브를 발행하며, 실행 가능한 복제본을 합성한 뒤 원본 스킬과의 차등 검증을 통해 반복적으로 수정하는 방식으로 작동한다. 규칙·표·절차·알고리즘을 아우르는 30개 스킬을 대상으로 실험한 결과, 여러 목표에 대해 정확하거나 부분적인 기능 복제에 성공했으며 반복적인 재질의가 단일 라운드에서 놓친 격차를 메웠다. 정당한 상호작용만 사용하므로 유출 방지 중심의 기존 방어는 제한적으로만 효과가 있고, 스킬 설명을 덜 상세하게 만드는 것도 큰 보호가 되지 못했다. 파일 자체를 숨기는 것만으로는 기능적 비밀성을 보장할 수 없으며, 누적적인 정보 유출을 통제하는 방어가 별도로 필요함을 시사한다.
- •공개 스킬 설명과 정상 사용만으로 폐쇄형 스킬의 기능을 복제하는 BSR 공격 SkillClone을 제안했다
- •인터페이스 가설 수립→구조화 프로브→합성→차등 검증 기반 반복 수정으로 작동한다
- •30개 스킬 대상 실험에서 여러 목표에 대해 정확 또는 부분 기능 복제에 성공했다
- •파일 유출 방지 중심의 기존 방어와 설명 단순화 모두 제한적 효과에 그쳤다
- •파일 비밀성만으로는 기능적 비밀성이 보장되지 않는다는 새 위협 모델을 제시한다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills
본문 미리보기
arXiv:2608.04192v1 Announce Type: new Abstract: Closed source agent skills may encode proprietary instructions, scripts, constants, and data. Providers may offer their capabilities as services while keeping the underlying packages hidden. Prior work focuses on prompt injection attacks that directly disclose these artifacts, and existing defenses accordingly aim to prevent such leakage. However, preventing file disclosure does not prevent users from recovering the functionality those files imple
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



