연구진은 금지된 프롬프트를 분할해 비즈네르(Vigenère) 암호와 ROT13을 이중으로 적용하고 자연어 재구성 지시를 결합한 탈옥(jailbreak) 파이프라인 'RoguePrompt'를 제시했다. 기존 연구가 필터 우회, 은닉 요청 복원, 실제 실행 성공 여부를 하나의 지표로 뭉뚱그려 평가해 다단계 공격이 어느 단계에서 실패하는지 알기 어려웠다는 문제의식에서 출발했다. API나 UI 접근만 가능한 블랙박스 위협 모델에서 실제 거부된 프롬프트 313개로 시험한 결과, 필터 우회율 93.93%, 지시 재구성 성공률 79.02%, 실제 실행 성공률 70.18%를 각각 기록했다. 이는 다층 프롬프트 인코딩 공격의 효과와 함께, 다단계 탈옥이 각 단계별로 어디서 실패하는지를 보여주는 세밀한 증거를 제공한다.
- •프롬프트를 분할해 비즈네르+ROT13 이중 인코딩과 자연어 재구성 지시를 결합한 탈옥 기법 RoguePrompt 제안
- •필터 우회·복원·실행 성공을 단계별로 분리 측정해 다단계 탈옥의 실패 지점을 규명
- •블랙박스 환경, 실제 거부된 313개 프롬프트로 시험해 필터 우회율 93.93% 기록
- •지시 재구성 성공률 79.02%, 최종 실행 성공률 70.18%로 다층 인코딩 공격의 실효성 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation
본문 미리보기
arXiv:2607.27373v1 Announce Type: new Abstract: Large language models (LLMs) are becoming increasingly integrated into mainstream development platforms and daily technological workflows, typically behind moderation and safety controls. Despite these controls, preventing prompt-based policy evasion remains challenging, and adversaries continue to "jailbreak" LLMs by crafting prompts that circumvent implemented safety mechanisms. Prior work has established cipher-mediated interaction, code-embedd
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:06AI 초안



