미완성 문장 형태의 유해 프롬프트가 오픈 웨이트 LLM의 안전장치를 우회하는 현상을 '불완전 프롬프트 탈옥(IPJ)'으로 정식화하고 체계적으로 분석한 연구다. 문장 완성을 유도하는 다양한 어트랙터 유형을 분석한 결과, LLM은 문장이 끝날 때까지 거부를 체계적으로 지연하는 경향을 보였다. 파라미터 튜닝으로 불완전 유해 프롬프트 거부를 학습시켜도 콘텐츠 도메인과 어트랙터 유형 전반으로 일반화되지 않았다. 대신 문장 종결과 이어쓰기를 각각 담당하는 종결 뉴런·연속 뉴런 두 기능적 뉴런을 식별해, 뉴런 수준 개입이 더 정밀하고 견고한 IPJ 방어가 될 수 있음을 제시한다. 오픈 웨이트 모델 안전장치의 구조적 취약점을 드러낸 결과다.
- •미완성 유해 프롬프트가 문장 완성 경향을 통해 안전장치를 우회하는 IPJ 현상을 최초 정식화
- •LLM은 문장 종결 시점까지 거부를 체계적으로 지연하는 경향 확인
- •파라미터 튜닝 기반 방어는 도메인·어트랙터 유형 간 일반화 실패
- •종결 뉴런·연속 뉴런 두 기능적 뉴런을 식별—뉴런 수준 개입이 정밀 방어 대안으로 제시
Incomplete Prompt Jailbreaks in Large Language Models
본문 미리보기
arXiv:2607.20473v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly released as open-weight models with safeguards against harmful requests. Nevertheless, sentence completion remains vulnerable to incomplete harmful prompts. In this work, we formalize this phenomenon as incomplete prompt jailbreaks (IPJ) and provide a systematic empirical characterization of when and how incomplete prompts elicit harmful continuations. We analyze diverse attractor types associated with
전체 내용이 궁금하다면?
원문을 직접 읽어보세요