이 연구는 안전 파인튜닝 챗 모델의 거부(refusal)가 잔차 스트림의 단일 선형 방향으로 매개된다는 Arditi 외(2024)의 결과를 출발점으로, 차분평균(DiM) 기반 개입과 반복 영공간 투영(INLP) 기반 개입을 다섯 개 오픈웨이트 모델에서 비교한다. INLP의 반사실적 뒤집기(counterfactual flipping)는 거부 억제에서 DiM 방향 제거와 경쟁력이 있는 반면, 영공간 투영은 일관되게 약했다. INLP를 추출 부분공간의 주요 방향으로 제한하면 거의 기준선 수준의 퍼플렉시티를 유지하면서 억제 효과 대부분을 보존해 조절 가능한 기법이 된다. 기하학적으로 영공간 투영은 활성값을 유해·무해 군집 사이로 붕괴시키는 반면 반사실적 뒤집기는 반대 군집으로 이동시켜, 모델이 개념의 '부재'와 '반대'를 다르게 부호화함을 시사한다.
- •거부(refusal) 조종에서 DiM 기반 개입과 INLP 기반 개입을 5개 오픈웨이트 모델에서 비교
- •INLP 반사실적 뒤집기는 DiM 방향 제거와 거부 억제 성능이 대등, 영공간 투영은 일관되게 약함
- •INLP를 주요 방향으로 제한하면 기준선 수준 퍼플렉시티로 억제 효과 대부분 보존—조절 가능한 기법
- •영공간 투영은 활성값을 유해·무해 군집 사이로, 반사실적 뒤집기는 반대 군집으로 이동
- •모델이 개념의 '부재'와 '반대'를 다르게 부호함을 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Refusal Beyond a Single Direction: A Preliminary Comparison of Diff-in-Means and INLP
- 1.안전 미세조정 모델의 거부를 단일 선형 방향(DiM)으로 본 기존 연구를 INLP와 비교
- 2.5개 오픈웨이트 챗 모델서 DiM 개입과 INLP 영공간 사영·반사실 뒤집기 비교
- 3.INLP 반사실 뒤집기는 거부 억제서 DiM 방향 제거와 경쟁력, 영공간 사영은 일관되게 약함
- 4.INLP를 주요 방향으로 제한하면 저perplexity 유지하며 억제 효과 보존, 조정 가능
왜 중요한가?
거부가 단일 방향만으로 매개되지 않을 수 있음을 보이고, 모델이 개념의 '부재'와 '반대'를 다르게 인코딩한다는 단서를 제시해 안전 정렬의 해석성 연구에 새 방향을 연다.
언급 프로젝트
LLM의 유해 질문 거부 메커니즘을 심층적으로 분석하는 이 연구는 국내 AI 안전성 및 윤리적 개발에 매우 중요한 의미를 가집니다. 한국 기업들이 안전하고 책임감 있는 LLM 서비스를 구축하고 배포하기 위해, AI의 내부 작동 방식을 이해하고 제어하는 데 필수적인 기술적 통찰을 제공할 것입니다.
본문 미리보기
arXiv:2606.13720v1 Announce Type: new Abstract: Arditi et al. (2024) has shown that refusal in safety fine-tuned chat models is mediated by a single linear direction in the residual stream, recoverable by a difference-in-means (DiM) of harmful and harmless activations. We compare DiM-based interventions (activation addition and directional ablation) with two interventions derived from Iterative Nullspace Projection (INLP) -- nullspace projection and counterfactual flipping -- on five open-weigh
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:49AI 초안

