연구진은 공개 가중치 LLM이 그래디언트 학습 없이 단일 GPU에서 몇 분 만에 안전 정렬을 무력화할 수 있는 표현 공학 공격(화이트박스 위협)에 취약하다는 문제에 대응해, 가중치 수준 방어 기법 Bait-and-Recover를 제안했다. 공격자가 활성화를 읽는 지점에 '미끼 어댑터'를 배치하고 다음 레이어에 '회복 어댑터'를 짝지어 배치함으로써 관찰 경로와 행동 경로를 분리하며, 그래디언트 라우팅으로 학습된다. 측정에 사용되는 잔차 신호를 능동적으로 오염시켜 공격자의 편집 탐색을 방해하는 동시에, 회복 레이어가 다운스트림의 정상적인 연산을 복원한다. 4개의 공개 가중치 모델에서 엄격한 행동 보존 예산(KL≤0.10) 하에 화이트박스 편집 탐색에 대한 최소 거부율을 16.25%에서 71.75%로 끌어올렸으며, 일반 벤치마크 성능에는 거의 영향이 없었다.
- •표현 공학(화이트박스) 공격에 대응하는 가중치 수준 방어 Bait-and-Recover 제안
- •미끼 어댑터와 회복 어댑터를 짝지어 관찰 경로와 행동 경로를 분리
- •그래디언트 라우팅으로 학습, 잔차 신호를 능동적으로 오염시켜 공격자 탐색 방해
- •4개 공개 가중치 모델에서 최소 거부율을 16.25%→71.75%로 대폭 향상
- •엄격한 행동 보존 예산(KL≤0.10) 하에서도 일반 벤치마크 성능 저하 미미
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Bait-and-Recover: Poisoning Internal Refusal Signals to Defend LLMs against White-Box Editing Jailbreaks
- 1.오픈웨이트 LLM의 표현공학(화이트박스 편집) 탈옥 공격 방어법 Bait-and-Recover 제안
- 2.관츰경로에 미끼 어댑터, 후속층에 복구 어댑터 배치해 관찰·행동 경로 분리
- 3.잔차 신호를 능동 오염시켜 공격자의 편집 탐색을 교란, 복구층이 정상 연산 복원
- 4.4개 오픈모델에서 최소 거부율을 16.25%→71.75%로 향상, 일반 성능 저하는 미미
왜 중요한가?
공개 가중치 모델은 GPU 한 대로 몇 분 만에 안전정렬을 무력화하는 저비용 화이트박스 공격에 취약한데, 이 방법은 공격의 핵심 전제인 활성화 관측 신뢰성을 무너뜨려 기존 행동수준 안전학습을 보완하는 실용적 방어층을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2609.05794v1 Announce Type: new Abstract: Open-weight large language models face a low-cost white-box threat from representation engineering attacks. Attackers can estimate refusal directions and search for projection-matrix edits that suppress safety alignment while preserving general capabilities, within minutes on a single GPU and without gradient-based training. We propose Bait-and-Recover, a weight-level defense that places a bait adapter where attackers read activations and a paired
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

