SearchAuditor는 장기간에 걸친 웹 탐색으로 답을 찾는 딥서치 에이전트의 실패 원인을 자동으로 진단하는 프레임워크다. 연구팀은 먼저 8개 오픈웨이트 모델이 5개 딥서치 벤치마크에서 실패한 궤적 1243건(평균 73.1개 메시지, 6만 5100토큰)을 수집해 핵심 오류 단계·검색 특화 근본 원인·참조 수정안을 전문가가 라벨링한 SearchAuditBench를 구축했다. 이를 바탕으로 근거 기반 판정을 통해 실패를 위치 파악·귀인·수정하는 다관점 감사 프레임워크 SearchAuditor를 제안했다. GPT-5.5 같은 최상위 모델을 쓴 가장 강력한 베이스라인조차 종단 간 통과율이 26.6%에 그친 반면, SearchAuditor는 32.3%로 모든 베이스라인을 일관되게 앞섰고 수정안을 적용해 실패한 실행을 재개하면 에이전트의 오류 복구력도 향상됐다.
- •1243건의 실패 굤적을 전문가 라벨링한 SearchAuditBench 벤치마크 구축
- •다관점 근거 기반 판정으로 실패 위치·원인·수정안을 제시하는 SearchAuditor 제안
- •GPT-5.5 기반 최강 베이스라인도 종단 간 통과율 26.6%에 불과
- •SearchAuditor는 통과율 32.3%로 모든 프론티어 모델 베이스라인 상회
- •수정안으로 실패 실행 재개 시 에이전트 오류 복구력 향상 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents
본문 미리보기
arXiv:2608.05212v1 Announce Type: new Abstract: Deep search agents tackle challenging questions through long-horizon web interactions, a process that is both complex and fragile: small reasoning errors may propagate through long, noisy trajectories into fluent but incorrect answers. Diagnosing such failures is difficult, requiring the manual inspection of extremely long execution traces, which could be beyond human capacity. We therefore introduce SearchAuditBench, a benchmark that evaluates wh
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

