LLM 안전 정렬이 표면적이어서, 유해 의도를 창작 서사로 포장하는 "Semantic Camouflage" 공격에 취약하다는 점을 보인 연구다. Phi-3, Qwen2.5, Gemma-2b 세 SLM의 잠재 활성화 궤적을 분석해, 전체 레이어의 15~20% 지점인 "Intent Horizon"에서 유해 의도 표상이 안전한 서사로 붕괴됨을 발견했다. 후반부 레이어는 위장 공격과 정상 질의를 거의 구분 못했지만(탐지율 20% 미만), 초반부 레이어에는 뚜렷한 "유해 시그니처"가 남아있었다. 이를 활용한 경량 방어 기법 Latent Intent Verification(LIV)은 PKU-SafeRLHF 데이터셋에서 기존 가드레일보다 20~50%p 높은 성능으로 재학습 없이 제로데이 공격을 무력화했다.
- •Phi-3, Qwen2.5, Gemma-2b 세 SLM에서 전체 레이어의 15~20% 지점(Intent Horizon)에 유해 의도 표상 붕괴 확인
- •후반부 레이어 표상은 위장 공격과 정상 질의를 거의 구분 못함(탐지율 20% 미만)
- •초반부 레이어에는 유해 의도의 뚜렷한 시그니처가 남아있어 탐지 가능
- •경량 프로빙 방어 LIV, PKU-SafeRLHF에서 기존 가드레일 대비 20~50%p 성능 우위
- •모델 재훈련 없이 제로데이 시맨틱 공격 방어 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification
- 1.'시맨틱 위장' 공격이 유해 의도를 창작 서사로 감싸 표준 가드레일을 우회한다는 취약점 실증
- 2.Phi-3, Qwen2.5, Gemma-2b 3개 SLM에서 전체 레이어의 15~20% 지점 '의도 지평선' 발견
- 3.후반 레이어 표현은 위장 공격과 안전 질의가 구분 불가(탐지율 20% 미만)하지만 초반 레이어엔 흔적 남아
- 4.경량 프로빙 방어 LIV 제안, PKU-SafeRLHF서 기존 가드레일 대비 20~50%p 우위, 재학습 불필요
왜 중요한가?
출력 단계 거부에만 의존하는 현재 안전정렬 방식의 구조적 한계를 보여주고, 모델 재학습 없이 내부 활성화만으로 탐지율을 크게 높이는 실용적 방어책을 제시한다.
본문 미리보기
arXiv:2608.20378v1 Announce Type: new Abstract: Safety alignment in Large Language Models (LLMs) is often superficial, relying on refusal mechanisms that trigger only at the final stages of generation without erasing the foundational knowledge of harmful concepts acquired during pretraining. This study demonstrates that this architectural disconnect leaves models vulnerable to Semantic Camouflage -- adversarial attacks that wrap harmful intent in benign narrative contexts (e.g., creative writin
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
