이 논문은 블랙박스 가드레일이 획득하는 안전 점수가 실제로는 가드레일과 표적 모델(자체 정렬) 두 구성요소의 합이라는 점을 지적하며, 평가에 기록되지 않는 두 변수(페이로드가 전달되는 채널, 방어 시스템 내부 판독에 사용되는 텍스트)에 따라 가드레일의 실질 기여도가 전무에서 거의 전부까지 달라짐을 보인다. 가드가 응답을 차단하면 모델 응답을 대체하므로 두 집계가 분리 가능하다는 점을 이용해, 페이로드를 픽셀로 렌더링하면 가드가 아무것도 차단하지 못하고 모델이 모든 거부를 만들어내는 반면, 공격자가 실제 전송한 인코딩된 프롬프트를 판독하면 가드 기여가 소수에 그치고, 인코딩되지 않은 원 요청을 판독하면 가드가 거의 모든 것을 차단해 모델이 침묵하는 것으로 나타났다. 비인코딩 요청을 부여하면 가드 게이트의 측정 효과는 크게 부풀려지지만 캡션매개 재검토는 덜, 다수결 스무딩은 전혀 부풀려지지 않았으며, 원인은 해악판정 단계가 아니라 답변을 재생성하는 단계에 있었다. 참조 구현이 공격자가 보낸 것과 벤치마크가 기록한 것을 구분 못 하는 단일 프롬프트 필드로 모든 단계를 구성해 이 왜곡이 그대로 이식됨을 지적하며, 저자들 자신의 기존 발표 수치도 이번에 수정 대상에 포함됐다.
- •블랙박스 가드레일의 안전 점수가 가드+모델 자체 정렬 이 톡슬거리돈 합에 불과함을 입증
- •페이로드 전달 채널과 내부 판독 텍스트에 따라 가드 기여도가 0~100%까지 달라짐
- •비인코딩 요청을 부여하면 가드 게이트의 측정 효과가 크게 부풀려지는 반면 다수결 스무딩은 영향 없음
- •왜곡은 단일 프롬프트 필드가 공격자 입력과 벤치마크 기록을 구별못하는 참조구현에서 비롯된다고 지적
- •저자들 자신의 기존 발표 수치도 이번 수정 대상에 포함됨
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Whose Refusal Is It? The Unmeasured Contribution of Black-Box Multimodal Guardrails
본문 미리보기
arXiv:2608.08641v1 Announce Type: new Abstract: A black-box guardrail is evaluated as though the safety number it earns were its own. It is not. A defended pipeline holds two components that can refuse (the guardrail, and the target model out of its own alignment), and every reported metric is a sum over both. We show that the guardrail's actual share of the safety credited to it runs from none of it to essentially all of it, decided by two variables no evaluation records: which channel carries
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안



