오픈웨이트 언어모델의 안전 정렬은 'abliteration' 기법으로 몇 분 만에 제거될 수 있어, 저자들은 제거 자체를 막는 대신 제거된 상태를 속이는 '디코이 하드닝(Fool's Gold)' 방어를 제안했다. 안전장치가 제거되면 위험한 요청에 그럴듯하지만 핵심 요소가 조작된 '가짜' 답변이 나오도록 공격 시뮬레이션 안에서 훈련시키며, 정상 상태의 동작은 원본과 동일하게 유지한다. 5개 계열 7개 모델(9B~122B)에 적용한 결과 사전 등록된 효과 기준을 통과한 6개 모델에서 공격 상태 응답의 0.51~0.90이 가짜였고, 이 중 0.27~0.84는 방어 덕분이었으며 정상 상태 성능은 그대로 유지됐다. 다만 독립적인 정답 기준이 없으면 외부에서 가짜 답변과 진짜 답변을 구별할 방법이 없다는 한계도 함께 지적했다.
- •안전 정렬 제거(abliteration) 자체는 막지 못해 제거된 상태를 '속이는' 방어로 전환
- •위험 요청에 핵심 요소가 조작된 그럴드한 가짜 답변을 생성하도록 훈련
- •5개 계열 7개 모델 중 6개서 공격 상태 응답의 0.51~0.90이 가짜, 정상 성능 유지
- •외부에서 가짜와 진짜 답변을 구별할 독립 기준이 없다는 한계 인정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models
- 1."Fool's Gold"(decoy hardening) 제안, 안전정렬 제거(abliteration) 공격 후 허위 응답으로 대응하는 방어 기법
- 2.5개 모델군 7개 모델(9B~122B)에 적용, 6개 모델이 사전등록 효과 기준 통과
- 3.공격 상태 응답의 0.51~0.90이 디코이(허위 정보)로 전환되면서도 정상 상태 성능은 유지
- 4.CBRNE 인접 벤치마크에서 방어된 122B 모델이 매칭 품질 응답의 0.82~0.86에서 치명적으로 틀림(무방어 대비 최대 0.10)
왜 중요한가?
오픈 웨이트 모델의 안전정렬은 몇 분 만에 제거 가능해 기존 방식으로는 durably 막을 수 없다는 전제 아래, 제거 자체를 막는 대신 제거 이후 답변을 허위로 오염시키는 새로운 방어 패러다임을 제시했다는 점에서 오픈소스 AI 안전 정책에 시사점이 크다.
본문 미리보기
arXiv:2608.17202v1 Announce Type: new Abstract: Safety alignment in open-weight language models is trivially removable: abliteration projects a refusal-mediating direction out of the weights in minutes, and no release-time defense we are aware of prevents it durably. What cannot be prevented can be deceived. Our defense, decoy hardening ("Fool's Gold"), concedes the refusal strip and poisons its payoff: once refusal is stripped, most answers to hazardous operational requests are confident, flue
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
