이 연구는 안전성 벤치마크가 프롬프트를 단 하나의 정형화된 표현으로만 평가하는 방식이 LLM의 실제 위험을 과소평가한다는 사실을 보여준다. 370개 시드 문장을 의미는 동일하되 표현만 다른 5가지 형태(역번역, 코드스위칭 등)로 바꿔 5개 모델에 테스트한 결과, 정형 표현만으로는 놓치는 위험한 응답이 표현들의 합집합 기준으로 최대 12.9%포인트까지 더 발견됐다. 정형 표현에서는 안전했던 시드의 5~13%가 표현만 바꾸면 위험한 응답으로 이어졌으며, 이는 온도 0에서 반복 샘플링해도 나타나지 않는 격차였다. Gemini 2.5 Pro에서 이 격차가 가장 컸고, 단일 표현 형태로는 모델이 보이는 위험 표면의 절반 정도만 포착할 수 있었다.
- •동일 의도, 다른 표현(역번역·코드스위칭) 5종으로 안전성 벤치마크의 한계 검증
- •표현 형태의 합집합 기준 위험 응답이 단일 최악 표현보다 3.3~12.9%p 더 발견됨
- •정형 표현에서 안전 판정된 시드의 5~13%가 다른 표현에서는 위험하게 응답
- •Gemini 2.5 Pro에서 표현에 따른 위험도 격차가 가장 크게 나타남
- •단일 표현 형태는 모델이 보이는 전체 위험 표면의 약 53%만 포착
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity
본문 미리보기
arXiv:2608.02665v1 Announce Type: new Abstract: A benchmark score is a measurement instrument, yet most benchmarks read each item at a single canonical surface form. We ask whether that reading is faithful: when an item's intent is held fixed and only its meaning-preserving surface form varies, does the canonical-form score estimate model behavior well, and how much of any variation is decoding/judge noise rather than signal? We instantiate this in safety, a high-stakes setting with no gold lab
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



