연구진은 자율 AI 에이전트를 멀티모달 상호작용 과제로 평가하는 GUI 환경에서, 기존 AndroidWorld·MobileWorld 등 벤치마크가 실제 모바일 사용의 다양성과 복잡성을 충분히 반영하지 못한다는 문제를 지적하며 새로운 벤치마크 'GMA(General Mobile Assistants)'를 제시했다. GMA는 라이프스타일 공유, 여행 계획 등 다양한 영역의 오픈소스 프로젝트 기반 애플리케이션 7종과, 단순 동작부터 복잡한 다단계 워크플로까지 4단계 난이도로 구성된 300개 과제를 포함한다. 8개 최상위 모델을 평가한 결과 과제 복잡도가 높아질수록 성능이 크게 저하되어, 현재 에이전트들이 현실적인 사용자 요구를 안정적으로 처리하기에는 아직 거리가 있음이 드러났다. 컨텍스트 유지와 명시적 상태 추적 등 에이전트 하네스 설계에 대한 통제 실험에서는 적절한 하네스 설계가 특히 까다로운 워크플로에서 성능을 유의미하게 개선할 수 있음을 확인했다.
- •실제 모바일 사용 다양성·복잡성 반영한 새 벤치마크 'GMA' 제시
- •라이프스타일·여행 등 오픈소스 기반 앱 7종, 4단계 난이도 300개 과제 구성
- •8개 최상위 모델 평가, 과제 복잡도 증가할수록 성능 급격히 저하
- •컨텍스트 유지·상태 추적 등 하네스 설계 통제 실험 병행
- •적절한 하네스 설계가 까다로운 워크플로 성능을 유의미하게 개선함을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Benchmarking General Mobile Assistants in Challenging Real-World Scenarios
- 1.GMA: AndroidWorld·MobileWorld의 한계를 보완해 실제 모바일 사용 복잡성을 다루는 새 벤치마크 제안
- 2.오픈소스 기반 7개 앱과 생활·여행계획 등 영역에서 원자동작부터 다단계 워크플로까지 4단계 난이도 300개 과제 구성
- 3.8개 최신 모델 평가 결과 과제 복잡도가 높아질수록 성능이 크게 떨어져 현재 에이전트가 실사용 요구를 안정적으로 처리하지 못함
- 4.맥락 유지·명시적 상태추적 등 하네스 설계 통제 실험에서 적절한 설계가 성능을 유의미하게 개선하나 모델별 효과는 상이함
왜 중요한가?
기존 모바일 에이전트 벤치마크가 다루지 못한 현실적 복잡도를 보강해, 모바일 에이전트의 실전 신뢰성 격차와 하네스 설계의 중요성을 정량적으로 드러낸다.
언급 프로젝트
본문 미리보기
arXiv:2608.27477v1 Announce Type: new Abstract: Graphical user interfaces have emerged as an important environment for evaluating autonomous AI agents on multimodal interactive tasks. Existing benchmarks such as AndroidWorld and MobileWorld provide strong foundations for mobile agent evaluation, but their application coverage and task design do not yet fully capture the diversity and complexity of realistic mobile use. We present GMA, a benchmark for evaluating general mobile assistants in chal
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
