이 논문은 LLM 에이전트 지식 작업 평가에서 높은 벤치마크 성능이 실제 배포 환경의 작업 수행으로 이어지지 않는 문제를 진단하고, 벤치마크 태스크가 작업 활동을 얼마나 대표하는지 명시하는 3단계 접근법을 제안한다. O*NET 직업 태스크 데이터베이스에서 18개 작업 활동 목록을 도출하고, GDPval(비코드 직업 산출물)·OfficeQA Pro(문서 분석)·APEX-SWE(소프트웨어 엔지니어링) 3개 벤치마크 사례 분석을 통해 설계 선택이 점수가 지지할 수 있는 최강 작업 주장을 어떻게 형성하는지 보여준다. 지식 작업은 역할·현지 자료·도구·다운스트림 워크플로우에서 사용 가능해야 하는 산출물로 조직된다는 점을 강조한다. 벤치마크 설계·보고 방식의 표준화를 통해 AI 지식 작업 연구의 신뢰성을 높이는 데 기여한다.
- •O*NET에서 도출한 18개 작업 활동 목록으로 평가 대상 작업 활동 명시화
- •3단계 접근법: 작업 활동 정의 → 테스트 설정 명세(자료·도구·역할·제약) → 작업 산출물 채점
- •GDPval·OfficeQA Pro·APEX-SWE 3개 벤치마크 사례로 설계 선택과 작업 주장 간 격차 분석
- •지식 작업은 역할·현지 자료·다운스트림 워크플로우에서 사용 가능한 산출물로 조직된다는 점 강조
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Design and Report Benchmarks for Knowledge Work
- 1.현행 LLM 에이전트 벤치마크는 전통 NLP 논리를 따라 높은 점수가 실세계 지식 업무 수행을 보장하지 않음
- 2.O*NET DB에서 도출한 18개 업무 활동 인벤토리로 태스크를 업무 활동에 매핑하는 3단계 벤치마크 설계 방법론 제안
- 3.GDPval·OfficeQA Pro·APEX-SWE 3개 사례에서 벤치마크 설계 선택이 점수의 업무 주장 범위를 어떻게 결정하는지 실증
왜 중요한가?
벤치마크 점수와 실배포 능력 간 간극을 체계적으로 분석한 연구로, AI 코딩·연구·의료 분야 에이전트 평가 기준 재설계에 실용적 가이드라인을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2605.23262v1 Announce Type: new Abstract: The development of LLM agents has led to a growing body of work on knowledge-work AI, including coding, research, and healthcare. However, current knowledge-work evaluation and benchmark design still largely follow the logic of traditional NLP tasks. As a result, higher benchmark performance does not reliably show that a system can carry out knowledge work in real-world deployment settings. This paper contributes a three-step approach for making e
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

