이 연구는 여러 스캐너가 공유 잠재 표현을 통해 서로 보완하며 악성 지시를 탐지하는 다중 스캐너 가드레일 시스템이 기존 단일 스캐너 우회 기법을 무력화한다는 점에 착안해, 이런 시스템을 우회하는 BRANCH 방법론을 제안한다. 브랜칭 트리 탐색으로 개별 스캐너에 적대적 교란을 동적으로 적용한 뒤, 우회 평가와 공격 신호 최적화를 분리해 전체 가드레일 시스템에서의 개선도를 기준으로 교란 최적화와 기법 선택을 수행한다. BRANCH는 6개 가드레일 시스템, 120개 시나리오에서 100%의 공격 성공률을 달성했으며, 기존 기법보다 쿼리 수는 72% 적고 소요 시간은 4.5배 짧으면서도 우회 과정에서 의미는 보존했다. 또한 BRANCH가 생성한 우회가 8개 상업용 블랙박스 가드레일을 포함한 29개의 미학습 가드레일로도 전이돼, 추가 최적화 없이도 일부 사례에서 공격 성공률을 100%까지 끌어올렸다.
- •다중 스았뛀 가드맸을 우회하는 미 탐색 기법 BRANCH 제안
- •전엱 가드맸 시스템 관맘도 기준으로 우회 평가와 공강 신호 최적화를 분리
- •6개 가드맸·120개 시니즈에서 100% 성고율, 쿼리 72% 절감·시간 4.5배 단축
- •29개 무습 강뛀 가드맸으로 전이되어 상업용 바이붜스 포한 일벀 100% 성고
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
BRANCH: Bypassing Multi-Scanner AI Guardrails
- 1.여러 스캐너로 구성된 멀티스캐너 가드레일을 우회하는 공격 기법 BRANCH 제안
- 2.브랜칭 트리 서치로 각 스캐너에 맞춘 적대적 변형 적용, 전체 개선도 기준으로 최적화
- 3.6개 가드레일·120개 시나리오에서 100% 공격 성공률, 질의 72%↓·시간 4.5배↓
- 4.29개 미확인 가드레일(상업용 블랙박스 8개 포함)에도 전이, 추가 최적화 없이 최대 100% 성공
왜 중요한가?
여러 스캐너를 묶어 안전성을 높였다고 여겨지는 최신 가드레일 구조조차 체계적으로 우회 가능함을 보여, AI 안전장치 설계자들이 단일 스캐너 간 공유 표현의 취약성을 재점검해야 함을 시사한다.
본문 미리보기
arXiv:2610.10742v1 Announce Type: new Abstract: AI systems increasingly rely on Large Language Models (LLMs) as core reasoning engines, making them targets for prompt injection and jailbreaks. Guardrails monitor and validate model inputs and outputs, yet their isolated, task-focused detection leaves gaps in their classification making them susceptible to bypasses. In response, guardrail systems formed by multiple scanners have emerged that collaboratively detect different types of malicious ins
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)