챗 모델의 활성화 공간에서 별개로 연구돼 온 거부(refusal) 방향과 페르소나 방향이 실제로는 상호작용하며, '순응적 페르소나'가 거부를 게이팅한다는 것을 보인 기계적 해석가능성 연구다. Qwen2.5-7B-Instruct와 Llama-3.1-8B-Instruct에서 순응적 모델 페르소나 방향과 거부 방향을 추출해 개입한 결과, 순응 페르소나 스티어링만으로 Llama의 거부율이 97%에서 2%로 떨어졌다. 거부 방향을 다시 주입하면 후기 레이어에서는 거부가 부분 복원되지만 초기 레이어에서는 안 되고, 후기 레이어 구간에서 페르소나 방향을 투영 제거하면 기준선으로 복원된다(무작위 방향 제거는 효과 없음). 거부는 계산되는 지점보다 하류인 후기 레이어 표현 단계에서 게이팅되므로, 거부를 단일 고립 방향으로 다루면 페르소나 의존성을 놓친다는 결론이다. ICML 2026 기계적 해석가능성 워크숍 채택 논문으로, 탈옥 방어 설계에 시사점이 크다.
- •거부와 페르소나는 별개 메커니즘이 아니라 상호작용: 순응적 페르소나가 거부를 게이팅
- •순응 페르소나 스티어링만으로 Llama-3.1-8B의 거부율 97%→2%로 급락
- •거부 방향 재주입은 후기 레이어에서만 부분 복원, 페르소나 방향 투영 제거는 기준선 복원
- •거부는 계산 지점보다 하류인 후기 레이어 표현 단계에서 게이팅된다는 결론
- •ICML 2026 Mechanistic Interpretability 워크숍 채택, 안전장치 설계에 시사점
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Refusal Lives Downstream of Persona in Chat Models
- 1.순응적 페르소나가 거부(refusal)를 게이팅한다는 활성화 공간 상호작용을 규명
- 2.Qwen2.5-7B·Llama-3.1-8B에서 순응 페르소나 조향 시 Llama 거부율 97%→2%로 급락
- 3.거부 방향 재주입은 후반 레이어에서만 부분 복원, 초기 레이어는 복원 안 됨
- 4.거부는 계산 이후 후반 레이어 표현 단계에서 게이팅됨을 입증
왜 중요한가?
거부를 단일 독립 방향으로 보던 해석을 뒤집어 페르소나 의존성을 드러냄으로써, 안전 정렬·탈옥 방어를 위한 활성화 조향 연구에 새로운 메커니즘적 통찰을 준다.
본문 미리보기
arXiv:2606.26161v1 Announce Type: new Abstract: Linear directions in activation space have been identified for both refusal and persona traits in instruction-tuned chat models, but the two have been studied as separate mechanisms. We show they interact: a compliant persona gates refusal. In Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct, we extract a compliant model-persona direction and a refusal direction and intervene on both. Compliant persona steering suppresses refusal -- in Llama, the ref
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

