컴퓨터 사용 에이전트(CUA)는 지속되는 작업공간 메모리를 통해 장기 실행 비서처럼 작동하는데, 오픈클로(OpenClaw) 방식 CUA는 사용자 지침·시스템 요약·외부 주장을 동일한 권한 수준으로 자동 재적재되는 파일에 저장해 저장된 주장이 이후 행동에 권한을 부여하게 된다. 이 때문에 공격자가 겉보기엔 무해한 외부 콘텐츠만 통제해도 정당한 작업 중에 공격자에게 유리한 주장을 메모리에 기록시키고, 그 주장이 공격자가 손대지 않은 다른 정상 작업까지 좌우하게 만드는 '지속 메모리 공격'이 가능하다. 연구팀은 평면적 작업공간 메모리를 명시적 권한 수준을 지닌 계층적 신뢰 구역으로 대체해 지속성과 권한을 분리하는 'ZoneClaw'를 제안한다. 외부 주장은 저신뢰 구역에만 머물며, 공격자가 직접 쓸 수 없는 구역과 교차 검증해야 명시적 권한 경계를 넘어 행동을 유도하는 권한을 얻을 수 있다. 네 가지 공격 시나리오 실험에서 ZoneClaw는 공격 성공률을 480건 중 372건에서 6건으로 낮추면서 458건에서 유용성을 유지했다.
- •오픈클로 방식 CUA는 사용자 지침과 외부 주장을 동일한 권한의 자동 재적재 메모리에 저장해 지속 메모리 공격에 노출될 수 있다는 문제를 제기.
- •공격자는 무해해 보이는 외부 콘텐츠만으로 정상 작업 중 유리한 주장을 메모리에 기록시켜 이후 다른 작업까지 좌우할 수 있음.
- •ZoneClaw는 메모리를 계층적 신뢰 구역으로 나눠 지속성과 권한을 분리하고, 외부 주장은 저신뢰 구역에만 머물도록 설계.
- •네 가지 공격 시나리오 실험에서 공격 성공률을 480건 중 372건에서 6건으로 낮추고 458건에서 유용성을 유지.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ZoneClaw: Mitigating Persistent Memory Attacks by Establishing Memory-Zoning in OpenClaw-Style Computer-Use Agents
- 1.OpenClaw 방식 컴퓨터 사용 에이전트의 영구 메모리를 악용하는 '지속 메모리 공격' 식별
- 2.양호해 보이는 외부 콘텐츠가 메모리에 주장을 주입해 이후 무관한 작업까지 조종하는 방식
- 3.방어기법 ZoneClaw 제안 — 메모리를 신뢰도별 '구역'으로 분리, 외부 주장은 명시적 권한 경계를 통과해야만 행동에 영향
- 4.4개 공격 시나리오 테스트에서 공격성공률을 372/480건에서 6/480건으로 감소, 유용성은 458/480건에서 유지
왜 중요한가?
에이전트가 장기 메모리를 신뢰하는 구조 자체가 새로운 공격면이 된다는 점을 드러내고, 메모리 접근 권한을 계층화하는 것만으로 공격을 대폭 차단하면서도 정상 기능은 거의 그대로 유지할 수 있음을 실증했다.
언급 프로젝트
장기 실행 AI 에이전트의 보안은 국내 기업들이 지능형 비서 시스템을 개발하고 도입하는 과정에서 핵심적인 고려사항입니다. 이 기술은 영구 메모리 공격을 완화하기 위해 메모리 존을 설정함으로써, 한국 시장에서 개인 및 기업용 AI 에이전트의 데이터 무결성과 신뢰성을 확보하는 데 중요한 방안을 제시합니다.
본문 미리보기
arXiv:2610.00450v1 Announce Type: new Abstract: Computer-use agents increasingly operate as long-running assistants through persistent workspace memory, which OpenClaw-style CUAs realize as automatically reloaded files that hold user instructions, system summaries, and external claims at the same privilege level. Here, remembering a claim confers authority over later behavior. This enables a persistent memory attack, in which an attacker who controls only benign-looking external content induces
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

