DCGS(Dialogue Critic Guided Sampling)는 멀티턴 대화에서 매 턴마다 사용자 의도를 추론해 LLM을 공격으로부터 방어하는 프레임워크다. 기존 안전 프레임워크가 대화 궤적을 무시한 채 각 턴을 독립적으로 다루는 한계를 지적하고, 적대적 대화를 마르코프 결정 과정(MDP)으로 모델링해 토큰·발화 수준의 가치/후회 기반 크리틱으로 후보 응답을 점수화한다. 이 추론 시점 재가중이 기본 정책의 지수적 틸팅을 근사해 유한 후보군에서 기대 수익 개선을 보장함을 이론적으로 증명했다. CARES-18k, WildJailbreak, Redbench, Harmbench에서 강력한 베이스라인과 프론티어 모델을 능가했고, 파인튜닝 없이 프론티어 모델에도 이식돼 견고성을 높였다. 선의의 질문과 점진적 공격을 구분해야 하는 실제 배포 환경에 유용한 접근이다.
- •멀티턴 공격에서 대화 전체 이력으로 사용자 의도를 매 턴 추론하는 DCGS 프레임워크 제안
- •적대적 대화를 MDP로 모델링, 토큰·발화 수준 가치/후회 기반 크리틱으로 응답 점수화
- •추론 시점 재가중이 기대 수익 개선을 보장함을 이론적으로 증명
- •CARES-18k·WildJailbreak·Redbench·Harmbench에서 견고한 베이스라인과 프론티어 모델 상회
- •파인튜닝 없이 프론티어 모델에 이식 가능—배포 환경 적용성 높음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Robust Critics: Defending LLMs Against Multi-Turn Attacks
- 1.DCGS 제안: 대화 전체 이력에서 매 턴 사용자 의도를 추론해 멀티턴 공격을 방어하는 프레임워크
- 2.적대적 대화를 MDP로 모델링, 토큰·발화 수준 가치·후회 크리틱으로 후보 응답 점수화
- 3.추론 시점 재가중이 기대 보상 개선을 보장함을 이론적으로 증명
- 4.CARES-18k·WildJailbreak·Harmbench 등에서 강력한 베이스라인과 프론티어 모델 상회
- 5.파인튜닝 없이 프론티어 모델에도 적용돼 강건성 향상
왜 중요한가?
기존 안전 프레임워크가 턴 단위로만 판단해 여러 턴에 걸쳐 서서히 드러나는 공격 의도를 놓치던 구조적 한계를 대화 궤적 기반 추론으로 해결했고, 파인튜닝 없이 프론티어 모델에도 이식된다는 점에서 실용성이 높다.
언급 프로젝트
다중 턴 공격으로부터 LLM을 방어하는 '강건한 비평가' 연구는 AI의 안전성과 사용자 신뢰를 높이는 데 핵심적인 역할을 합니다. 이는 국내 기업들이 개발하는 AI 챗봇 및 서비스가 유해한 콘텐츠에 효과적으로 대응하면서도 정당한 사용자 요청을 차단하지 않도록 균형을 맞추는 데 중요한 기반을 제공할 것입니다.
본문 미리보기
arXiv:2607.20472v1 Announce Type: new Abstract: When a user asks a language model something harmful, is it a genuine attack or a misunderstood but well-meaning question? This ambiguity is one of the central challenges of LLM safety. A model that assumes the worst harms legitimate users; one that assumes the best is easily exploited. The problem is compounded in multi-turn dialogue, where an attacker's true intent may only reveal itself gradually across many exchanges, yet existing safety framew
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

