에이전트 디버깅 도구에서 검증기(verifier)가 정답을 사실상 미리 노출시켜 솔버 비교 실험을 무의미하게 만들 수 있다는 구조적 결함을 보고했다. 정확한 최소 적중 집합(MHS) 기법과 그리디 기법이 개발 사례 12건 전부에서 동일한 결과를 냈는데, 감사 결과 이는 검증기의 「정확 앵커」 조건부가 계획된 결함 쌍을 9/9 사례에서 그대로 유출했기 때문이었다. 앵커 제거 후 복구율은 8/9로 낮아졌고, 1,440개 사례의 사전등록 평가에서 72개 구성 단위 중 55개가 참조 게이트를 통과했으며 허위 승인율은 0/20이었다. 저자들은 솔버를 최적화하기 전에 먼저 증거 적격성과 비노출성을 검증하는 「지원 게이팅」 프로토콜을 제안하며, 더 강력한 솔버가 실은 더 강력한 검증기 결함을 증명하는 것일 수 있다고 경고한다.
- •검증기의 '정확 앵커' 조건부가 계획된 결함 쌍을 9/9 사례에서 사전 유출해 솔버 비교를 무의미하게 만듦
- •앵커 제거 후 정확 최소 적중 집합(MHS)과 그리디 기법의 복구율이 8/9로 재조정됨
- •1,440개 사례 사전등록 평가에서 허위 승인율 0/20을 달성한 '지원 게이팅' 프로토콜 제안
- •솔버 최적화 전에 증거 적격성과 비노출성을 먼저 검증해야 한다는 에이전트 평가 방법론적 교훈
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Verifier Can Leak the Answer: Diagnosability Before Optimization in Closed-Loop Agent Debugging
- 1.에이전트 디버깅용 검증기가 정답을 암묵적으로 노출하면, 솔버 비교 자체가 무의미해질 수 있음을 실증
- 2.감사 결과 '정확 앵커' 서술자가 9/9 사례서 결함쌍을 그대로 노출, 제거 후 복구율 8/9 유지
- 3.참조맵 노출확인→런타임 증거비교→보정된 탐지 순의 '지지 증거 검증 계약' 제안
- 4.사전등록 테스트(1440사례)서 55/72 조합 통과, 거짓승인률 0/20(상한 0.1391)
왜 중요한가?
에이전트 평가 파이프라인에서 '검증기가 이미 답을 알고 있는' 숨은 결함을 짚어, 강력한 솔버가 실제로는 더 강한 검증기를 검증한 것에 불과할 수 있다는 방법론적 경고를 던진다.
본문 미리보기
arXiv:2610.00126v1 Announce Type: new Abstract: Agent developers increasingly compare prompts, tools, policies, and diagnosis algorithms through simulator-grounded verifiers. A verifier can nevertheless make a solver comparison vacuous: if its probes or predicates encode the target identity, an exact optimizer may appear effective without resolving any genuine ambiguity. We report such a failure in an aggregate-trace debugger for a closed-loop decision agent. Exact minimum hitting set (MHS) and
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

