정렬된 LLM 내부에서 유해성(harmfulness)과 거부(refusal)가 residual stream의 분리 가능한 방향으로 표현되며, 탈옥(jailbreak)은 토큰 생성 전 프롬프트 인코딩 단계에서 둘 중 하나를 억제해 성공한다는 사실을 규명했다. 흥미롭게도 모델은 입력을 유해로 인식하지 못했더라도 유해 콘텐츠를 생성하는 도중에는 이를 인식한다. 이를 바탕으로 프롬프트·응답 양쪽 위치에서 두 방향을 결합하는 파인튜닝 기법 HARC를 제안했고, 개입을 해당 부분공간에 한정해 일반 능력 저하나 과잉 거부 없이 6개 베이스라인 중 최고의 강건성-능력-사용성 균형을 달성했다. 5개 모델 계열·2개 스케일에 아키텍처별 튜닝 없이 전이된다는 점에서 실용적 안전 정렬 기법으로 주목된다.
- •탈옥은 프롬프트 인코딩 단계에서 거부 또는 유해성 방향을 억제해 성공, 공격 유형별로 유해성-거부 평면의 분리된 영역 점유
- •모델은 입력 판단에 실패해도 유해 콘텐츠를 생성하는 동안에는 유해성을 인식
- •HARC는 프롬프트·응답 위치 모두에서 두 방향을 결합하는 파인튜닝 기법으로, 일반 능력 저하·과잉 거부 없음
- •주요 훈련시·추론시 안전 기법 6개 베이스라인 대비 최고의 강건성-능력-사용성 균형, 5개 모델 계열에 무조정 전이
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment
- 1.탈옥은 토큰 생성 전 프롬프트 단계서 유해성·거부 방향 중 하나를 억제해 성공함을 규명
- 2.응답 토큰 단계에선 모델이 생성 중인 유해 콘텐츠를 스스로 인식함을 발견
- 3.두 방향을 프롬프트·응답 위치에서 결합하는 파인튜닝 기법 HARC 제안
- 4.6개 베이스라인 중 견고성·성능·사용성 최적 균형 달성, 5개 모델군 전이 확인
왜 중요한가?
탈옥이 왜 성공하는지 내부 표현 수준에서 설명하고, 일반 성능 저하나 과도한 거부 없이 안전성을 높이는 개입을 제시해 실제 LLM 정렬 전략 설계에 바로 활용할 수 있다.
언급 프로젝트
본문 미리보기
arXiv:2607.00572v1 Announce Type: new Abstract: Understanding how aligned LLMs internally represent safety is critical for diagnosing alignment vulnerabilities, as it explains why jailbreaks succeed and informs the design of robust alignment strategies. Prior work shows that aligned LLMs encode harmfulness and refusal as separable directions in the residual stream at prompt-side token positions. We show that jailbreaks succeed at prompt encoding by suppressing either the refusal or harmfulness
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

