연구진은 유해한 의도를 양성 과제와 결합해 숨기는 '의도 은폐형' 잴브레이크 공격을 정보이론 관점에서 분석했다. 각 과제에 유해하다고 판단될 추정 확률을 부여하고, 전체 과제 집합에 대한 평균을 사전확률, 표적을 포함한 선택된 묶음에 대한 평균을 사후확률로 정의한 뒤, 이 둘을 일치시키는 '사전-사후 매칭' 기법을 통해 묶음에 유해 표적이 남아 있어도 추정된 의도를 바꾸지 않을 수 있음을 보였다. 묶음 크기 제약 하에서 정확한 사전-사후 매칭은 계산적으로 어렵다는 것을 증명하고 분수 가중치에 대한 최적의 워터필링 해법을 도출했으며, 질의 구성 포함 여부에 따라 질의 독립적·질의 종속적 두 가지 설정을 연구했다. 여러 오픈소스 모델 실험에서 조합형 질의는 직접 요청 기준선을 넘어서는 표적 행동을 유도했지만, 묶음이 커질수록 표적 행동 보존률은 오히려 감소하는 트레이드오프가 나타났다.
- •유해 의도를 양성 과제와 결합해 숨기는 공격을 사전-사후 확률 매칭으로 정식화
- •묶음 크기 제약 하 정확한 매칭은 계산적으로 어려움을 증명, 분수 가중치용 워터필링 해법 제시
- •질의 구성 포함 여부에 따라 질의 독립적·질의 종속적 두 가지 설정 분석
- •여러 오픈소스 모델에서 조합형 질의가 직접 요청보다 효과적이나 묶음이 커질수록 표적 행동 보존률 감소
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Intent-Hiding Jailbreaks: An Information-Theoretic Framework for Compositional Attacks
- 1.무해한 과제 속에 유해 요청을 숨기는 '조합형 탈옥'을 정보이론적으로 분석한 프레임워크 제시
- 2.사전-사후 확률을 일치시키는 매칭 기법으로, 유해 목표가 남아 있어도 탐지 확률을 그대로 유지시키는 방법 규명
- 3.분수 가중치에 대한 최적 워터필링 해법을 도출하고, 안전 임계값을 만족하는 최소 번들 크기를 특정
- 4.조합형 질의가 직접 요청보다 유해 행동을 더 끌어내지만, 번들이 커질수록 목표 보존율은 오히려 감소
왜 중요한가?
개별적으로는 거부될 유해 요청이 양성 과제와 묶이면 탐지를 피해갈 수 있음을 수학적으로 정식화해, 단순 키워드·의도 분류 기반 안전 필터가 조합형 공격에는 구조적으로 취약할 수 있음을 보여준다.
본문 미리보기
arXiv:2610.02302v1 Announce Type: new Abstract: Recent work has shown that large language models (LLMs) can be vulnerable to jailbreak attacks in which harmful intent is obscured through composition with benign tasks. A harmful request refused in isolation may elicit a different response when embedded within a larger, seemingly benign query. We study these compositional intent-hiding jailbreaks from an information-theoretic perspective. Our formulation associates each task with an estimated pro
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

