LLM 에이전트 평가에서 실제 사용자의 다양한 행동 패턴을 반영하지 못하는 협력적·동질적 시뮬레이터의 한계를 극복하는 Persona Policies(PPol) 플러그인 제어 레이어를 소개합니다. LLM 기반 진화적 프로그램 탐색으로 태스크 목표를 보존한 다양한 페르소나를 생성하며, 인간 유사성과 행동 패턴 커버리지를 결합한 다목적 적합도 점수로 최적화합니다. tau^2-bench에서 기준 시뮬레이터 대비 적합도 33-62% 향상, 평가자의 80.4%가 인간으로 인식했으며, PPol 훈련 에이전트는 태스크 성공률 17% 향상됐습니다.
- •PPol은 실제 사용자 행동 다양성을 시뮬레이터에 주입하는 플러그인 제어 레이어
- •LLM 기반 진화적 프로그램 탐색으로 태스크 목표를 보존한 다양한 페르소나 생성
- •평가자의 80.4%가 PPol 페르소나를 인간으로 인식, 기준 시뮬레이터 대비 약 2배
- •PPol 훈련 에이전트가 분포 외 행동에서 태스크 성공률 17% 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents
- 1.LLM 사용자 시뮬레이터의 협조적·동질적 편향을 교정하는 Persona Policies(PPol) 제안
- 2.진화적 프로그램 탐색으로 현실적 다양한 페르소나를 자동 생성
- 3.소매·항공 도메인에서 적합도 점수 33~62% 절대 향상, 인간 판별율 80.4% 달성
- 4.PPol로 훈련된 에이전트가 분포 외 행동 대응 성공률 17% 상대 향상
왜 중요한가?
실제 사용자와의 차이를 좁히는 현실적 시뮬레이터는 LLM 에이전트의 강건성 평가와 훈련 품질을 근본적으로 개선할 수 있어 실용 AI 배포에 중요하다.
언급 프로젝트
본문 미리보기
arXiv:2605.12894v1 Announce Type: new Abstract: Large Language Model (LLM) agents are increasingly deployed in settings where they interact with a wide variety of people, including users who are unclear, impatient, or reluctant to share information. However, collecting real interaction data at scale remains expensive. The field has turned to LLM-based user simulators as stand-ins, but these simulators inherit the behavior of their underlying models: cooperative and homogeneous. As a result, age
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

