DCGS(Dialogue Critic Guided Sampling)는 멀티턴 대화에서 매 턴마다 사용자 의도를 추론해 LLM을 공격으로부터 방어하는 프레임워크다. 기존 안전 프레임워크가 대화 궤적을 무시한 채 각 턴을 독립적으로 다루는 한계를 지적하고, 적대적 대화를 마르코프 결정 과정(MDP)으로 모델링해 토큰·발화 수준의 가치/후회 기반 크리틱으로 후보 응답을 점수화한다. 이 추론 시점 재가중이 기본 정책의 지수적 틸팅을 근사해 유한 후보군에서 기대 수익 개선을 보장함을 이론적으로 증명했다. CARES-18k, WildJailbreak, Redbench, Harmbench에서 강력한 베이스라인과 프론티어 모델을 능가했고, 파인튜닝 없이 프론티어 모델에도 이식돼 견고성을 높였다. 선의의 질문과 점진적 공격을 구분해야 하는 실제 배포 환경에 유용한 접근이다.
- •멀티턴 공격에서 대화 전체 이력으로 사용자 의도를 매 턴 추론하는 DCGS 프레임워크 제안
- •적대적 대화를 MDP로 모델링, 토큰·발화 수준 가치/후회 기반 크리틱으로 응답 점수화
- •추론 시점 재가중이 기대 수익 개선을 보장함을 이론적으로 증명
- •CARES-18k·WildJailbreak·Redbench·Harmbench에서 견고한 베이스라인과 프론티어 모델 상회
- •파인튜닝 없이 프론티어 모델에 이식 가능—배포 환경 적용성 높음
Robust Critics: Defending LLMs Against Multi-Turn Attacks
본문 미리보기
arXiv:2607.20472v1 Announce Type: new Abstract: When a user asks a language model something harmful, is it a genuine attack or a misunderstood but well-meaning question? This ambiguity is one of the central challenges of LLM safety. A model that assumes the worst harms legitimate users; one that assumes the best is easily exploited. The problem is compounded in multi-turn dialogue, where an attacker's true intent may only reveal itself gradually across many exchanges, yet existing safety framew
전체 내용이 궁금하다면?
원문을 직접 읽어보세요