자가진화형 에이전트 스킬(SES) 시스템이 축적된 경험을 신뢰할 수 있는 지시어로 승격시키는 과정을 노리는 새로운 공격 'PoisonedEvolution'이 공개됐다. 이 공격은 대상 스킬을 관찰하고 제한된 증거만 제공할 수 있는 블랙박스 조건에서도, 목표 행동이 인과적으로 유용하고 반복적이며 일반화 가능한 것처럼 보이게 만들어 '증거 승격' 단계를 통과시킨다. 공격자 지분 10% 조건에서 SkillClaw의 6개 주요 LLM 진화기 대상 600회 시도 중 546회(91.0%) 성공했고, 구조가 다른 Trace2Skill 파이프라인에서도 600회 중 369회(61.5%) 성공해 서로 다른 진화 아키텍처 간 전이 가능성을 입증했다. 30개 기록 중 일관된 공격자 기록 3개만으로도 충분히 오염이 가능했다. 이는 경험을 스스로 학습해 스킬을 늘려가는 에이전트 시스템의 '증거 승격' 절차 자체가 새로운 보안 경계임을 보여준다.
- •자가진화형 에이전트 스킬 시스템을 겵냒하는 트래젝토리 오염 공격 PoisonedEvolution 제안
- •공격자 지분 10%에서 SkillClaw 대상 성공률 91.0%(546/600)
- •구조가 다른 Trace2Skill에서도 61.5%(369/600) 성공해 아키텍처 간 전이 입증
- •30개 기록 중 일관된 공격자 기록 3개만으로도 오염 가능
- •증거 승격 절차가 자가진화형 에이전트의 핵심 보안 경계임을 지적
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems
본문 미리보기
arXiv:2608.05563v1 Announce Type: new Abstract: Self-evolving skill (SES) systems distill agent trajectories into persistent skills, allowing untrusted experience to become trusted instruction. We introduce PoisonedEvolution, a trajectory-poisoning attack on this promotion process. Our skill-visible black-box attacker can inspect a target skill and contribute bounded evidence, but cannot observe private pools or evolution logic or edit the skill bank. Artifact poisoning requires Inclusion, Evol
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



