AgentHorizon은 컴퓨터 사용 에이전트의 장기 작업 성공 여부를 판정하는 자동 심사자(judge)의 신뢰성을 평가하기 위해, 세 가지 운영체제에서 166시간 분량의 인간 기록 궤적으로부터 추출한 1,373개 지시-궤적 쌍을 제공하는 벤치마크다. 밀접하게 관련된 지시들끼리 지시를 바꿔치기해 부정(negative) 과제를 만드는 방식으로, 심사자가 유사하지만 호환되지 않는 요청을 완료한 궤적과 실제 성공한 궤적을 구별할 수 있는지 평가한다. 최대 300개의 스크린샷·행동을 포함한 전체 궤적을 직접 판정하는 방식과 다섯 개 에이전트 하네스를 통해 코딩 에이전트로 활용하는 방식으로 11개 심사자를 평가했다. 최고 성능인 GPT-5.5는 AH 서브셋에서 80.9%의 균형 정확도를 기록했으며, 도구 사용은 일부 모델엔 도움이 되지만 오픈 웨이트 모델에는 오히려 성능을 떨어뜨리는 것으로 나타났다.
- •166시간 분량 인간 기록 궤적에서 추출한 1,373개 지시-궤적 쌍으로 컴퓨터 사용 에이전트 심사자 평가
- •유사하지만 호환되지 않는 지시로 부정 과제를 구성해 심사자의 구별 능력을 테스트
- •최고 심사자 GPT-5.5가 AH 서브셋에서 균형 정확도 80.9% 기록
- •도구 사용이 일부 모델엔 도움 되나 오픈 웨이트 모델엔 오히려 성능 저하 유발
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AgentHorizon: Evaluating Agentic Judges for Long-Horizon Computer-Use Tasks
- 1.AgentHorizon 발표: 166시간 인간 기록 트래젝토리로 만든 1,373개 컴퓨터사용 과제 벤치마크, 3개 OS 포함
- 2.비슷한 지시를 서로 바꿔 끼우는 페어드 디자인으로 성공·실패 트래젝토리 구분 능력 테스트
- 3.최고 심사모델 GPT-5.5가 균형정확도 80.9% 기록, 도구사용은 오픈웨이트 모델엔 오히려 성능 저하
왜 중요한가?
컴퓨터사용 에이전트의 '완료처럼 보이지만 실패한' 작업을 가려내는 자동심사 능력을 체계적으로 처음 측정, 무감독 평가·훈련 파이프라인의 신뢰성 기준을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2610.11050v1 Announce Type: new Abstract: Computer-use agents are capable of completing complex tasks, increasing the use of automatic judges to determine success, either for training or for evaluation without human involvement. Despite their flexibility, their reliability on long tasks spanning multiple applications remains unclear. A trajectory, composed of long sequences of screenshots and actions, may appear complete, but in reality violates constraints from the instruction or introdu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)