이 연구는 공개 AI 리더보드가 투표 조작, 비공개 변형 모델의 선택적 공개, 벤치마크 오염 등으로 쉽게 순위가 왜곡될 수 있다는 문제에서, 기록이 쌓인 후 계산해 각 쌍별 비교 주장과 함께 공개하는 '인증된 부패 예산'을 도입한다. 적어도 1-α의 확률로, 모든 시점에서 주장이 맞거나 일정 건수 이상의 기록이 조작된 것임을 보장하며, 모든 인증서를 지켜보는 공격자에게도 유효하다. 위조된 기록과 이미 본 기록을 변경하는 공격은 서로 다른 인증서를 필요로 하는데, 건당 비용이 약 두 배인 인증서는 미래를 보는 공격자에게도 일정한 베팅으로 유효성을 유지한다. 180만 건의 Chatbot Arena 투표로 재현한 결과, 수백 건의 조작된 투표만으로도 표준 신뢰구간은 잘못된 순위를 인증했지만 이 방법은 유효성을 유지했고, 명확히 구분되는 모델은 약 2,000건의 위조 투표까지 견뎌냈다.
- •리더보뗜 톰 조작·변형 모델 선택 유출에 대응하는 '인증된 부패 예산' 도입
- •인증서를 모두 지커보는 무제한 강력의 공격자에게도 통산적으로 유효한 보장 제개
- •위조와 변거막 감자 영향을 받은 증거가 설 수 있음
- •180만 건 Chatbot Arena 촬효읹 실출에서 수백 건 조작에도 통개 신니은 정보나름 유지
- •분윴척 형비 벘 2,000건의 위조 촬효읹까지 까연했다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Certified Corruption Budgets: Anytime-Valid Leaderboard Claims under Adaptive Rigging
- 1.AI 리더보드 순위 조작에 대응하는 '인증된 손상 예산' 개념 제안
- 2.매 비교 주장마다 손상 허용치를 공개, 공격자가 전 과정을 지켜봐도 무한 예산으로 못 깨짐
- 3.위조·사후변경 기록에 각기 다른 인증서가 필요, 비용 2배 인증서는 미래를 보는 공격자에도 유효
- 4.180만건 Chatbot Arena 투표 재현에서 수백건 조작만으로 기존 신뢰구간은 틀린 순위를 인증, 새 방법은 유효성 유지
왜 중요한가?
투표 조작·비공개 변형 선택공개·벤치마크 오염에 공개적으로 노출된 AI 모델 리더보드의 신뢰성을, 공격자가 전 과정을 지켜봐도 깨지지 않는 통계적 보증으로 뒷받침해 모델 평가·투자 판단의 근거 신뢰도를 높인다.
언급 프로젝트
본문 미리보기
arXiv:2610.10597v1 Announce Type: new Abstract: Public leaderboards for AI models are read continuously, and attackers can see every published standing. Vote rigging, selective disclosure of private variants, and benchmark contamination can each move a ranking. Existing guarantees assume genuine records or bound the corruption per step, which an attacker who corrupts in bursts evades. We introduce the certified corruption budget, a tolerance $\widehat{B}_t$ computed after $t$ records and publis
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)