FinPerMA는 금융 자문 등 고위험 영역에서 LLM 에이전트가 장기간에 걸쳐 개인화된 사용자 모델을 유지·갱신할 수 있는지 평가하는 이벤트 기반 벤치마크다. 결정론적 규칙, 통제된 LLM 내레이션, 자동 품질 검수를 결합한 파이프라인으로 276명의 페르소나에서 2,994개 문항을 구축했으며, 중대 이벤트 발생 후 에이전트가 이를 지속 모델에 반영했는지 확인하는 'Post-Shock' 체크포인트를 도입했다. 7개 프론티어 LLM을 테스트한 결과 전체 정확도는 약 0.47, 객관식 정확도는 약 39%를 넘지 못했다. 요약 기반 메모리는 사실 정보는 보존하지만 개인화에 필요한 선호 신호를 잃는 경향이 있어, 단순 검색이 목적 특화 메모리 시스템보다 오히려 나은 성능을 보였고 이 격차는 충격 이벤트 이후 더 커졌다.
- •FinPerMA, 금융 자문 LLM 에이전트의 장기 개인화 메모리 유지 능력을 평가하는 이벤트 기반 벤치마크
- •276개 페르소나 기반 2,994개 문항, 중대 이벤트 반영 여부를 확인하는 Post-Shock 체크포인트 도입
- •7개 프론티어 LLM 테스트 결과 전체 정확도 약 0.47, 객관식 약 39%로 미포화 상태
- •요약 기반 메모리는 사실은 보존하나 개인화 선호 신호 손실, 단순 검색이 오히려 우수
- •충격 이벤트(Post-Shock) 이후 메모리 시스템 간 성능 격차 확대
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
본문 미리보기
arXiv:2608.04095v1 Announce Type: new Abstract: Large language model (LLM) agents are increasingly used as personalized assistants in high-stakes domains such as financial advising, yet it remains unclear whether they can maintain and update an individualized user model over long horizons. Existing personalized-memory benchmarks primarily test factual retention or rely on weakly constrained model-generated trajectories, leaving event-driven preference adaptation underexplored. We introduce FinP
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

