Daydreaming은 호스팅된 에이전트 서비스가 숨겨둔 다중 파일 스킬을 정상적인 작업 요청만으로 훔쳐내는 실행 전용(execution-only) 공격이다. 스킬 공개나 재구성 결과 채점을 요구하지 않고, 공격자가 설계한 과제들의 결과 차이만으로 숨겨진 동작을 구별해낸다. 개별 동작을 테스트하고 공격자 통제 하의 섀도 에이전트로 설계를 선택한 뒤, 저장된 피해자 응답과 로컬 실행 검증을 이용해 각 파일을 완성한다. 공격자가 최종 응답과 반환 파일만 볼 수 있는 Output 접근 수준에서, 7개 스킬·4개 피해자 모델에 걸쳐 원본 스킬 능력의 86.8%를 복원해 기존 SigLeak 대비 약 4배 뛰어난 성능을 보였으며, 공개 방어가 걸려 있어도 스킬당 중앙값 32회의 피해자 호출만으로 설치 가능한 스킬을 만들어냈다.
- •스킬 공개 요청 없이 정상 작업 상호작용만으로 숨겨진 다중 파일 스킬을 훔치는 실행 전용 공격
- •Differential·Trace·Output 세 단계 위협 수준을 정식화하고 가장 제한적인 Output 접근에 집중
- •7개 스킬·4개 모델에서 원본 능력의 86.8% 복원, SigLeak 대비 약 4배 성능
- •공개 방어가 활성화된 상태에서도 스킬당 중앙값 32회 호출만으로 설치 가능한 스킬 재구성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction
- 1.정상 작업 요청만으로 블랙박스 AI 에이전트의 비공개 스킬을 훔치는 Daydreaming 공격 공개
- 2.스킬 공개를 직접 요구하지 않고 결과를 변별하는 작업을 설계해 숨겨진 동작을 추론하는 방식
- 3.Differential·Trace·Output 3단계 위협 수준 정의, 최종 응답만 보는 Output 수준을 중점 실험
- 4.7개 스킬·4개 피해 모델 대상 실험에서 원본 기능의 86.8% 복원, 기존 SigLeak 대비 약 4배 우수
왜 중요한가?
스킬 파일을 숨기고 직접적 노출만 차단하는 기존 방어가 정상 사용 패턴을 통한 기능적 복제를 막지 못함을 실증해, 스킬 판매·호스팅 서비스 사업자에게 새로운 종류의 지식재산 유출 위협을 경고한다.
언급 프로젝트
본문 미리보기
arXiv:2608.26733v1 Announce Type: new Abstract: Agent skills bundle instructions, reference data, and executable helpers that let a general agent perform specialized tasks. Hosted providers can keep these files secret while selling access to task results, making the skill itself a valuable target. Existing disclosure defenses can block requests that ask for the skill or reproduce its text, but they cannot block customers from submitting the ordinary tasks the service is built to complete. We pr
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
