연구진이 오픈웨이트 LLM 6종에서 공통적으로 작동하는 새로운 재일브레이크 기법 'PEV(Perturbed Embedding Vector)'를 제시했다. 기존 공격 기법은 그래디언트 계산, 프롬프트별 최적화, 모델 내부 가중치 변경 등이 필요했지만 PEV는 프롬프트의 임베딩 벡터에 독립적인 가우시안 노이즈를 반복적으로 더하는 것만으로 유해 응답을 유도한다. 제일브레이크벤치(JailbreakBench) 실험에서 PEV는 첫 공격 성공까지 걸리는 평균 연산 비용이 기존 기법보다 최대 10배 적었고, 테스트한 모든 모델에서 1분 이내에 첫 성공적 재일브레이크를 달성했다. 다른 어떤 방법도 더 오랜 시간이 걸리면서 이 정도 성과를 내지 못해, 임베딩 교란이 중요한 보안 위험이자 LLM 동작 연구 도구가 될 수 있음을 시사한다.
- •6개 오픈웨이트 LLM에 공통 작동하는 재일브레이크 기법 'PEV' 제시
- •임베딩 벡터에 가우시안 노이즈만 반복 추가, 그래디언트 계산·내부 가중치 변경 불필요
- •첫 공격 성공까지 평균 연산 비용이 기존 기법 대비 최대 10배 감소
- •테스트한 모든 모델에서 1분 이내 첫 성공적 재일브레이크 달성
- •임베딩 교란이 심각한 보안 위험이자 LLM 동작 연구에 유용한 도구가 될 수 있음을 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Jailbreaking Open-Weight LLMs via Random Embedding Perturbations
- 1.임베딩 벡터에 독립 가우시안 잡음만 더하는 단순한 jailbreak 공격 'PEV(Perturbed Embedding Vector)' 제시
- 2.그래디언트 계산·프롬프트별 최적화·내부 가중치 변경 없이도 6개 오픈웨이트 LLM 안전장치를 우회
- 3.JailbreakBench 전 모델·전 프롬프트에서 유해응답 생성 성공, 다른 어떤 기법도 이 수준을 달성 못함
- 4.첫 성공까지 평균 연산비용이 기존 공격의 최대 10분의 1, 모든 모델에서 1분 내 첫 성공 달성
왜 중요한가?
복잡한 최적화 없이 임베딩에 단순 잡음만 넣어도 오픈웨이트 LLM 안전장치가 전면 무력화된다는 사실은, 현재 안전정렬이 입력표현의 미세한 교란에도 매우 취약함을 드러내 모델 배포 전 임베딩 공간 강건성 점검이 필요함을 시사한다.
언급 프로젝트
본문 미리보기
arXiv:2610.07125v1 Announce Type: new Abstract: While open-weight models have enjoyed steady progress in capabilities and wide adoption across multiple domains, their safety remains an important concern. One key feature is the ability to refuse or deflect harmful, malicious, or insensitive prompts. In this paper, we expose safety vulnerabilities across six common open-weight LLMs of various sizes that consistently lead to harmful or unsafe responses on the JailbreakBench benchmark dataset. Our
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

