CRG(Capability-Routed Guard)는 대형추론모델(LRM)이 추론 맥락이나 작업 분해를 조작당해 유해 목표를 정당한 추론 단계로 처리하는 새로운 안전 실패 유형에 대응하는 모델 비종속형 추론시점 가드레일이다. 기존 안전 리마인더나 외부 분류기, 자가검증 방식은 공격이 악용하는 표면을 그대로 검사하거나 같은 표면에서 추가 안전 추론을 시키기 때문에 취약했다. CRG는 사이드채널 컨트롤러로 사용자의 승인된 작업·활성 맥락·안전 증거·역량전이 위험에 대한 신뢰 가능한 표현을 먼저 구성해 실행 가능한 의도와 신뢰할 수 없는 추론 맥락을 분리하고, 고위험 요청은 차단, 모호한 요청은 제한, 저위험 요청은 신뢰된 맥락으로 전달하는 경로 기반 방어를 수행한다. TraceCheck로 승인된 작업과의 일관성을 검증하고 제한된 폴백을 호출해 양성 저위험 요청의 유용성도 보존하며, 실험에서 다양한 추론 중심 탈옥을 효과적으로 완화하면서 과잉 거부 문제도 줄인 것으로 나타났다.
- •추론 맥락 조작을 통한 LRM 탈옥에 대응하는 모델 비종속형 추론시점 가드레일 CRG 제안
- •사이드채널 컨트롤러로 실행 가능 의도와 신뢰할 수 없는 추론 맥락을 분리
- •고위험 차단·모호 제한·저위험 전달의 경로 기반 방어 수행
- •TraceCheck로 작업 일관성 검증, 다양한 추론 중심 탈옥 완화하면서 과잉거부 이슈도 감소
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Capability-Routed Guard: Defending Large Reasoning Models Against Reasoning-Centric Jailbreaks
본문 미리보기
arXiv:2608.07892v1 Announce Type: new Abstract: Large reasoning models (LRMs) expose a new safety failure mode: adversarial prompts can manipulate reasoning context, task decomposition, or capability interpretation so that harmful objectives are processed as legitimate reasoning steps. Existing safeguards, including safety reminders, external classifiers, and self-checking wrappers, are often brittle because they either inspect the adversarial prompt directly or ask the target model to perform
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안



