대형 파운데이션 모델이 개방 환경에 널리 배치되면서 안전 위협은 블랙박스 탈옥에서 내부 안전 뉴런이나 경로를 직접 겨냥하는 화이트박스 공격으로 옮겨가고 있다. 기존 방어는 고정된 안전 유닛이나 거부 경로에 의존해 경로 단위 화이트박스 공격에 취약했다. 이 연구는 안전 경로가 손상돼도 견고한 거부 행동을 유지하도록 동적 보완 경로를 도입하는 동적 라우팅 적응형 정렬(DRAA)을 제안한다. 안전/비안전 보정 샘플 간 내부 활성화 대조로 모델의 안전 경로를 식별·국소화한 뒤, 이 경로를 마스킹해 인위적으로 방어 실패를 유도하고 이를 선별해 실패 인식 선호도 쌍을 구성한다. 광범위한 실험에서 DRAA는 모델의 안전 경로 의존 구조를 재편해 경로 단위 화이트박스 공격에 대한 견고성을 크게 높이면서도 일반적 유용성은 유지했다.
- •안전 위협이 블랙박스 탈옥에서 내부 안전 경로를 겨냥한 화이트박스 공격으로 이동
- •안전/비안전 활성화 대조로 모델의 안전 경로를 식별·국소화
- •안전 경로를 의도적으로 마스킹해 실패 인식 선호도 쌍을 구성하는 DRAA 제안
- •동적 보완 경로 도입으로 안전 경로 손상 시에도 거부 행동 유지
- •경로 단위 화이트박스 공격 견고성 크게 향상, 일반 유용성도 보존
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks
본문 미리보기
arXiv:2608.02674v1 Announce Type: new Abstract: With the widespread deployment of large foundation models (LFMs) in open environments, safety threats are shifting from black-box jailbreaks toward white-box attacks that directly identify and disrupt internal safety neurons or routes. However, existing safety defenses often rely on static safety units or fixed refusal pathways, leaving models highly vulnerable to targeted route-level white-box attacks. For that, we propose dynamic routing adaptiv
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



