APeB(Agent Personalized Benchmark)는 사용자가 모호하고 다듬어지지 않은 질의를 던지는 상황에서 LLM 에이전트의 개인화 능력을 평가하는 벤치마크다. 실제 행동 로그에서 불명확한 의도, 풍부한 상호작용 이력, 사용자가 실제로 본 후보 상품을 짝지어 개인화 상품 검색(PPS) 테스트베드를 구축했다. 최신 LLM을 다단계 에이전트 워크플로로 평가한 결과, 명시적 질의는 잘 처리하지만 의도·선호 발견이 필요한 초기 단계 질의에서는 성능이 크게 떨어졌고, 루브릭 분석 결과 그 원인은 주로 이력 활용 실패였다. 이력 인지 질의 정제 파이프라인 VQRA를 적용하면 일관된 성능 향상이 나타나, 개인화 에이전트에 전용 이력 활용 모듈이 필요함을 보여준다.
- •다듬어지지 않은 원본 질의와 다양한 이력 기반의 개인화 상품 검색(PPS) 테스트베드 구축
- •실제 행동 로그에서 모호한 의도·풍부한 이력·사용자 열람 후보 상품을 짝지어 벤치마크 생성
- •최신 LLM도 의도·선호 발견이 필요한 초기 단계 질의에서 성능 저조, 주원인은 이력 활용 실패
- •이력 인지 질의 정제 파이프라인 VQRA로 일관된 성능 향상 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
APeB: Benchmarking Personalization Ability of Large Language Model Agents
본문 미리보기
arXiv:2607.03162v1 Announce Type: new Abstract: LLM-powered agents struggle with personalization when users issue raw, underspecified queries. In this setting, agents must infer latent intent, extract preferences from noisy interaction histories, and select among competing alternatives. Existing benchmarks rarely test this capability, as they often rely on user-refined queries or simplified histories. We introduce personalized product search (PPS), a testbed for agentic personalization under ra
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

