AutomationBench는 영업·마케팅·운영·지원·재무·HR 등 실제 업무 흐름을 반영하여 AI 에이전트의 크로스 애플리케이션 워크플로우 오케스트레이션 능력을 평가하는 새 벤치마크다. 에이전트는 REST API 엔드포인트를 스스로 발견하고, 정책 문서를 따르며, 무관하거나 오해를 유발하는 레코드 사이를 탐색해야 한다. 채점은 결과 데이터가 올바른 시스템에 안착했는지로 프로그래밍 방식으로 이뤄진다. 현재 최신 프런티어 모델조차 점수가 10% 미만에 머물러 실무에서 요구되는 에이전트 역량과 큰 격차가 있음을 보여준다.
- •Zapier 패턴 기반 6개 도메인의 실제 비즈니스 워크플로우를 평가용 과제로 구성
- •에이전트가 자체적으로 API 엔드포인트를 탐색하고 다층 비즈니스 규칙을 따라야 함
- •최종 상태(end-state) 기반 프로그래밍 채점으로 객관성 확보
- •최첨단 프런티어 모델도 10% 미만 성공률로 큰 역량 격차 노출
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AutomationBench
- 1.REST API 기반 교차 앱 워크플로우 자동화를 평가하는 AutomationBench
- 2.Zapier 실 워크플로우 패턴으로 영업·마케팅·운영·지원·재무·HR 포괄
- 3.에이전트가 엔드포인트를 스스로 찾아 정책 준수하며 정확 데이터 기록
- 4.최고 프론티어 모델도 10% 미만, 현 에이전트의 기업 적용 격차 드러냄
왜 중요한가?
기업 자동화 현장 요구에 비춘 AI 에이전트의 실질 격차를 보여주는 현실적 평가 체계로 투자·개발 방향성에 기준 제공
언급 프로젝트
본문 미리보기
arXiv:2604.18934v1 Announce Type: new Abstract: Existing AI benchmarks for software automation rarely combine cross-application coordination, autonomous API discovery, and policy adherence. Real business workflows demand all three: a single task may span a CRM, inbox, calendar, and messaging platform - requiring the agent to find the right endpoints, follow a policy document, and write correct data to each system. To address this gap, we introduce AutomationBench, a benchmark for evaluating AI
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

