다중 턴 공격에서 유해성과 거부 표현이 어떻게 변화하는지를 분석한 연구가, 라마-3.1-8B, Qwen2.5-7B, 젬마-2-9B 등 3개 모델을 크레센도, 액터어택, 엑스티밍 등 3가지 다중 턴 공격 프레임워크로 테스트했다. 각 공격 프레임워크는 서로 다른 기하학적 방향을 거치면서도 비슷한 성공률로 유해 출력을 유도했으며, 다중 턴 유해성 방향은 대화가 진행될수록 중후반 레이어의 턴 종료 토큰 위치에서 점점 더 선형적으로 분리 가능해졌다. 반면 유해성 표현과 거부 관련 표현은 약하게만 연관돼 있어, 다중 턴 공격이 모델 내부의 유해성 인식 자체를 억제해서 성공하는 것이 아니라는 결론을 뒷받침한다. 연구진은 이 결과가 단일 턴 기반 안전 점검이 다중 턴 상황에서 효과가 떨어지는 이유를 설명하며, 견고한 방어를 위해서는 시간적 표현 동역학을 고려해야 한다고 제언한다.
- •라마-3.1-8B, Qwen2.5-7B, 젬마-2-9B를 대상으로 세 가지 다중 턴 공격의 내부 표현 변화를 분석
- •각 공격은 서로 다른 기하학적 방향을 거치지만 비슷한 성공률로 유해 출력을 유도
- •다중 턴 유해성 방향은 대화가 진행될수록 중후반 레이어에서 점점 선형적으로 분리 가능해짐
- •유해성 표현과 거부 관련 표현은 약하게만 연관되어 있어 다중 턴 공격이 유해성 인식 억제로 성공하는 것이 아님을 시사
- •단일 턴 기반 안전 점검의 한계를 설명하며 시간적 표현 동역학을 고려한 방어 필요성을 제기
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Geometry of Harmfulness in Multi-Turn Attacks
- 1.Llama-3.1-8B, Qwen2.5-7B, Gemma-2-9B에서 멀티턴 탈옥 공격의 내부 표현 변화를 분석
- 2.Crescendo·ActorAttack·X-Teaming이 서로 다른 기하학적 방향을 타지만 성공률은 비슷
- 3.턴이 진행될수록 모델 중후반 레이어에서 유해성 표현이 선형적으로 더 뚜렷하게 분리됨
- 4.유해성 표현과 거부 표현의 연관성은 약해, 단일턴 방어가 멀티턴에서 약화되는 이유 시사
왜 중요한가?
멀티턴 공격이 거부 메커니즘을 억누르는 게 아니라 대화가 진행될수록 유해성 신호 자체가 선명해진다는 점을 보여줘, 안전장치 설계가 대화 전체의 시간적 흐름을 고려해야 함을 시사한다.
본문 미리보기
arXiv:2609.38389v1 Announce Type: new Abstract: Large language models (LLMs) remain vulnerable to adversarial attacks that circumvent safety alignment to elicit harmful outputs. It remains unclear how harmfulness and refusal representations evolve over the course of multi-turn attacks, and why single-turn defenses are less effective in multi-turn settings. This work investigates how the geometry and temporal dynamics of harmfulness and refusal representations evolve across multi-turn attacks. W
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

