RiskWebWorld는 이커머스 리스크 관리용 GUI 에이전트 평가를 위한 최초의 현실적 인터랙티브 벤치마크다. 실제 리스크 관리 파이프라인에서 가져온 1,513개 태스크를 8개 도메인에 걸쳐 제공하며, 비협조적 웹사이트와 부분 환경 하이재킹 같은 실제 난관을 반영한다. Gymnasium 호환 인프라로 정책 플래닝과 환경 역학을 분리. 평가 결과 최상위 범용 모델이 49.1%, 특화 오픈웨이트 GUI 모델은 거의 실패 수준의 극명한 격차. 에이전틱 RL로 오픈소스 모델 16.2% 개선.
- •이커머스 리스크 관리용 GUI 에이전트 최초의 현실 벤치마크
- •실제 리스크 관리 파이프라인 기반 1,513 태스크, 8 도메인
- •비협조적 웹사이트·환경 하이재킹 등 실전 난관 반영
- •최상위 범용 모델 49.1% vs 오픈웨이트 GUI 모델 거의 실패
- •Gymnasium 호환 인프라, 에이전틱 RL로 +16.2% 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
RiskWebWorld: A Realistic Interactive Benchmark for GUI Agents in E-commerce Risk Management
- 1.이커머스 리스크 관리용 GUI 에이전트 현실 벤치마크 공개
- 2.범용 대형 모델이 특화 오픈 모델 대비 극명한 우위
- 3.파운데이션 모델 스케일이 현재로선 제로샷 UI 이해보다 중요
왜 중요한가?
GUI 에이전트 연구가 벤치마크가 벗어난 실제 업무에 얼마나 못 가는지 정량화. 이커머스 리스크 관리 같은 고위험 도메인에서 AI 에이전트 상용화 경로의 실증 기준이 됨.
언급 프로젝트
본문 미리보기
arXiv:2604.13531v1 Announce Type: new Abstract: Graphical User Interface (GUI) agents show strong capabilities for automating web tasks, but existing interactive benchmarks primarily target benign, predictable consumer environments. Their effectiveness in high-stakes, investigative domains such as authentic e-commerce risk management remains underexplored. To bridge this gap, we present RiskWebWorld, the first highly realistic interactive benchmark for evaluating GUI agents in e-commerce risk m
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 15:12AI 초안

