StepJack은 컴퓨터 사용 에이전트(CUA)를 겨냥한 새로운 공격 유형인 다단계 간접 프롬프트 주입을 벤치마킹한 연구다. 하나의 악의적 목표를 여러 개의 무해해 보이는 하위 단계로 쪼개 에이전트의 탐색 경로에 놓인 여러 페이지에 분산 배치하는 자동 분해 파이프라인을 개발했으며, 480개 테스트 사례로 구성된 StepJack 벤치마크를 구축했다. 6개 최신 CUA를 평가한 결과 3개에서 다단계 공격이 공격 성공률을 최대 31.2%포인트까지 끌어올렸으며(예: GPT-5.4-mini는 단일 단계 41.7%에서 3단계 72.9%로 상승), 참조 체인을 안정적으로 따라가는 5개 CUA 평균으로도 31.3%에서 36.9%로 상승했다. 공격 목표를 여러 단계로 은밀히 분산시키는 것만으로 기존 단일 단계 방어를 우회할 수 있음을 보여준다.
- •악의적 목표를 무해해 보이는 하위 단계로 쪼개 여러 페이지에 분산하는 공격
- •480개 사례의 StepJack 벤치마크로 6개 최신 CUA 평가
- •일부 CUA는 다단계 공격 시 공격 성공률이 최대 31.2%p 상승
- •참조 체인을 따라가는 CUA 평균 성공률도 31.3%→36.9%로 상승
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection
본문 미리보기
arXiv:2608.06477v1 Announce Type: new Abstract: Computer-use agents (CUAs) face a growing threat from indirect prompt injection, where adversarial instructions are planted in the environment such as web pages. In this paper, we introduce multi-step indirect prompt injection, a new attack class against CUAs in which the adversarial goal is decomposed into multiple innocuous-looking sub-steps and distributed across a chain of pages referenced along the agent's navigation path. We develop a pipeli
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



