언어모델의 안전 학습이 사후에 임의로 변경(제거·조작)됐는지 활성화 공간 구조만으로 탐지하는 도구 'AMS(Activation-based Model Scanner)'가 공개됐다. Llama, Gemma, Qwen, Mistral 등 4개 아키텍처 계열 14개 모델 설정을 대상으로 검증한 결과 임계값 교차검증 정확도는 71%(10/14)였고, JailbreakBench 프롬프트에 대한 행동적 순응도와도 유의미한 상관관계(피어슨 r=-0.546)를 보였다. 연구진은 안전 학습 변형을 활성화 공간 신호에 따라 4가지 유형으로 분류했는데, 학습 제거와 가중치 직교화 기반 탈검열은 탐지 가능하지만 행동적 파인튜닝만으로 이뤄진 변형은 활성화 기반 탐지로는 잡아내지 못하는 한계도 드러났다. 오픈소스 모델의 안전장치 무력화를 저비용으로 검증할 수 있는 실용적 도구지만, 완전한 탐지 커버리지에는 아직 미치지 못한다는 점을 시사한다.
- •활성화 공간의 기하학적 구조 변화로 안전 학습 변조 여부를 탐지
- •4개 아키텍처· 14개 모델 구성에서 교차검증 정확도 71% 기록
- •안전성 변형을 4개 범주(학습제거·가중치직교화·방향회전·행동파인튜닝)로 분류
- •행동 파인튜닝만으로 이루어진 안전 변형은 활성화 기반 탐지로 감지 불가함을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Detecting Safety Training Modification in Language Models via Activation Analysis
본문 미리보기
arXiv:2608.05578v1 Announce Type: new Abstract: We introduce AMS (Activation-based Model Scanner), a tool that detects modifications to safety training in language models by measuring the geometric structure of safety-relevant concepts in activation space. Safety training creates measurable separation between harmful and benign content classes; certain safety modifications collapse or rotate this structure, while others leave it intact. We validate AMS across 14 model configurations spanning 4
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



