AgentLens는 코딩 에이전트를 '과제 통과 여부' 단일 비트가 아니라 전체 궤적(trajectory)으로 평가하는 프로덕션 검증 벤치마크다. 실제 사용자는 에이전트가 지시를 따르는 방식, 도구 사용, 자기 검증, 실수 복구, 소통 과정 전체를 경험한다는 문제의식에서 출발했다. 객관적 검증이 가능한 부분은 형식 검증으로, 나머지는 LLM이 작성하는 궤적 리뷰와 나란히 비교로 평가해, 각 실행마다 점수의 이유를 읽을 수 있는 설명이 생성된다. 저자들은 이를 모델 순위 매기기를 넘어 모델 행동 진단, 자사 에이전트 버전 비교, 야간 평가 파이프라인의 제품 회귀 감지에 활용하며, 벤치마크를 오픈소스로 공개했다. 코딩 에이전트 품질 관리를 실무에 도입하려는 팀에 참고할 만한 사례다.
- •통과/실패 단일 비트가 아닌 지시 준수·도구 사용·자기 검증·복구·소통 전체 굤적 평가
- •형식 검증 + LLM 작성 굤적 리뷰 + 나란히 비교의 결합 구조
- •실행마다 점수 근거를 설명하는 가독한 리뷰 생성
- •모델 행동 진단, 에이전트 버전 비교, 야간 파이프라인 회귀 감지에 실제 활용
- •GitHub에 오픈소스로 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
- 1.코딩 에이전트 평가 벤치마크 AgentLens 공개, 합곉 여부가 아닌 전체 굤적 평가
- 2.지시 준수·도구 사용·자가 검증·오류 복구·사용자 소통 등 트래젝토리 전반 채점
- 3.형식 검증+LLM 굤적 리뷰+병렬 비교 결합, 점수 근거를 읽을 수 있는 설명 제공
- 4.야간 평가 파이프라인의 제품 회귀 감지에 활용, GitHub 오픈소스 공개
왜 중요한가?
통과/실패 이진 채점에 머물던 코드 에이전트 벤치마크를 사용자 경험 관점의 궤적 평가로 확장해, 에이전트 제품의 회귀 감지와 버전 간 비교에 바로 적용할 수 있는 도구를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2607.06624v1 Announce Type: new Abstract: We present AgentLens, a production-assessed benchmark for interactive code agents. Most code-agent benchmarks reduce a run to a single bit -- did the task pass? -- but the people who actually use these agents experience the entire trajectory: how the agent follows instructions, uses its tools, verifies its own work, recovers from mistakes, and talks to them along the way. AgentLens evaluates that whole trajectory. It pairs formal verification, whe
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

