StoreBench는 LLM 에이전트가 실제 상거래 백엔드에서 중간 규모 온라인 의류 매장을 운영하며 장기 계획과 경제적 판단력을 테스트하는 라이브 커머스 환경이다. 고객 주문, 공급업체 가격 변동·실패, 시장 충격이 예고 없이 발생하는 가운데 에이전트는 사람이 쓰는 것과 동일한 29개 상인 도구로 대응해야 한다. 7개 프론티어 LLM을 11개 시나리오에서 평가한 결과, 최고 모델 DeepSeek-V4-Pro도 스크립트 기반 휴리스틱 정책의 97% 통과율에 크게 못 미치는 49%에 그쳤고, 인간 전문가(평균 0.708)가 모든 모델(최고 0.700)을 앞섰다. 다만 Qwen3.5-27B를 5개 과제로 GRPO 후훈련시키자 held-out 과제 평균 점수가 0.136에서 0.373으로 뛰어, 적은 데이터로도 상업 운영 능력을 끌어올릴 여지가 있음을 보였다.
- •29개 상인 도구로 실제 상거래 백엔드를 운영하는 라이브 커머스 에이전트 벤치마크 StoreBench 공개
- •최고 모델 DeepSeek-V4-Pro도 과제-시드 조합 통과율 49%로 스크립트 휴리스틱(97%)에 못 미침
- •인간 전문가 평균 복합점수 0.708이 전체 모델 최고치 0.700을 앞섬
- •Qwen3.5-27B를 5개 과제로 GRPO 후훈련하자 held-out 평균 점수가 0.136→0.373로 상승
- •평가 환경과 채점 도구 일부만 공개, 전체 환경은 벤치마크 오염 방지를 위해 비공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
StoreBench: A Live-Commerce Environment for Evaluating and Training Autonomous Operator Agents
- 1.온라인 의류 매장을 운영하는 라이브 커머스 벤치마크 StoreBench 공개, 29개 상인 도구로 평가
- 2.최고 모델 DeepSeek-V4-Pro도 과제-시드 49%만 통과, 스크립트 휴리스틱의 97%에 못 미침
- 3.인간 전문가 평균 종합점수 0.708로 모든 모델(최고 0.700)을 앞섬
- 4.GRPO 후훈련으로 Qwen3.5-27B가 5개 과제만 학습해도 종합점수 0.136→0.373으로 상승
왜 중요한가?
정적 벤치마크와 달리 공급자가 가격을 바꾸는 동적 환경에서 프런티어 LLM이 인간 전문가나 단순 휴리스틱에도 못 미쳐, 에이전트의 경제적 의사결정 능력이 과대평가됐을 가능성을 제기한다.
본문 미리보기
arXiv:2610.10942v1 Announce Type: new Abstract: Reinforcement learning environments are now a primary lever for improving large language model (LLM) capabilities in post-training, yet most agentic benchmarks remain static: the world moves only when the agent acts, the reward is a terminal verdict, and the pass bar is set arbitrarily. We introduce StoreBench, a live-commerce environment in which an agent runs a mid-size online apparel store on a production-grade commerce backend, testing long-ho
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)