이 연구는 LLM 탈옥(jailbreak) 공격 평가가 공격 예산을 고려하지 않은 채 공격성공률(ASR)만 비교해 불공정한 비교를 낳는다는 문제를 지적하고, 타깃 모델 호출 횟수를 기준으로 삼는 Fair-ASR 평가 프로토콜을 제안했다. 11개 대표 공격 기법을 동일 예산 하에서 재평가한 결과 예산에 따라 순위가 크게 달라졌고, 단순한 무작위 변형이나 손수 제작한 템플릿이 동일 접근 조건에서도 여전히 경쟁력이 있었으며, 평가한 어떤 LLM 기반 공격도 타깃·공격자 호출 양쪽에서 효율적이지 않았다. 이런 효율성 격차에 착안해 개발한 ReCode는 저비용 요소들을 조합한 공격으로, 타깃 호출 20회 예산 내에서 GPT-5에 85%의 ASR을 달성하면서 요청당 평균 7.19회의 공격자 호출만 필요로 했다.
- •타겟 호출 횟수 기준의 Fair-ASR 프로토콜로 예산 미고려 비교 문제 해결
- •11개 대표 탈옥 공격 재평가 결과 예산에 따라 순위가 크게 변동
- •단순 무작위 변형·수제 템플릿도 동일 예산에서 여전히 경쟁력 확인
- •ReCode는 타겟 호출 20회로 GPT-5에 ASR 85% 달성, 공격자 호출도 저비용
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets
- 1.탈옥(jailbreak) 공격 평가의 공정성을 위해 동일한 타겟 호출 예산 하에 비교하는 Fair-ASR 프로토콜 제안
- 2.기존 11개 대표 탈옥 공격을 재평가한 결과, 예산 기준에 따라 공격 순위가 크게 뒤바뀜
- 3.단순 확률적 변형이나 수작업 템플릿도 동일 접근 조건에서는 여전히 경쟁력 있는 성능
- 4.신규 공격 ReCode는 타겟 호출 20회 예산에서 GPT-5 대상 85% 성공률을 공격자 호출 평균 7.19회로 달성
왜 중요한가?
FLOPs 대신 관측 가능한 타겟 호출 수를 기준 삼아 블랙박스 모델 간 공정한 탈옥 방어력 비교를 가능하게 하며, 예산 조건에 따라 기존 벤치마크 순위가 뒤바뀔 수 있음을 보여줘 LLM 안전성 평가 방법론에 재검토를 요구한다.
본문 미리보기
arXiv:2608.17360v1 Announce Type: new Abstract: Reliable jailbreak evaluation is essential for assessing LLM safety, but most existing studies rely solely on attack success rate (ASR) without accounting for its dependence on attack budgets, resulting in unfair comparisons across methods. Existing compute-aware evaluations reduce heterogeneous resources into FLOPs, which is difficult to estimate for black-box models and fails to capture resource-specific constraints. To provide a comparable eval
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
