AuditRepairBench는 에이전트 수리 리더보드에서 평가자 채널 신호 유출로 인한 순위 불안정 문제를 정량화하는 576,000개 셀 규모의 패어드-실행 추적 코퍼스이다. 학습된 영향 프록시, 규칙 기반 채널 노출 비율, 반사실적 민감도 프록시, 희소 인간 감사 프록시의 4가지 스크리닝 구현을 결합한 모듈식 아키텍처를 제공한다. 스크리닝 기반 블라인딩 패치는 50줄 미만의 코드로 순위 이탈을 평균 62% 줄인다.
- •에이전트 수리 리더보드는 평가자 재구성 시 순위가 바뀌며, 일부 방법은 평가자 채널 신호로 내부 후보 선택을 편향시킨다.
- •AuditRepairBench는 576,000개 등록 셀, 80개 소스 수준 채널 수술 서브셋, 독립 발견 프로토콜로 구성된 대규모 검증 자원이다.
- •4가지 스크리닝 구현의 조합 앙상블은 79개 케이스에서 풀링 AUROC 0.83을 달성했다.
- •스크리닝 기반 블라인딩은 50줄 미만의 코드로 순위 이탈을 평균 62% 줄이며, 무작위 블라인딩(7%)이나 일반 재훈련(13%)을 크게 상회한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AuditRepairBench: A Paired-Execution Trace Corpus for Evaluator-Channel Ranking Instability in Agent Repair
- 1.에이전트 수리 리더보드의 평가자 채널 순위 불안정성 문제를 분석한 AuditRepairBench 공개
- 2.57만 6천개 등록 셀, 4가지 스크리닝 구현으로 평가자 신호 유출에 의한 순위 변동 측정
- 3.스크리닝 기반 블라인딩 패치로 순위 이동 평균 62% 감소 달성
- 4.규칙 전용 경량 버전 AuditRepairBench-Lite를 24 GPU-시간으로 주요 결과물로 공개
왜 중요한가?
AI 평가의 신뢰성 위협인 평가자 재구성에 따른 순위 역전 문제를 문서화하고, 재현 가능한 평가 체계를 위한 실용적 해결책을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2605.04624v1 Announce Type: new Abstract: Agent-repair leaderboards reorder under evaluator reconfiguration, and a measurable share of the reordering is produced by methods that consult evaluator-derived signal during internal selection of candidate repairs. We document this failure mode on a public leaderboard and release AuditRepairBench, a paired-execution trace corpus of 576,000 registered cells (96,000 executed) that operationalizes evaluator-channel-blocking ranking instability with
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

