PM-Bench는 LLM 에이전트의 전향 기억(prospective memory)—다른 활동을 하는 중에 특정 미래 신호나 상태에서 의도를 실행하는 능력—을 측정하는 텍스트 기반 벤치마크다. 인지과학의 Virtual Week 패러다임에서 착안해, 시뮬레이션된 7일 동안 에이전트가 진행 중인 활동을 계속하면서 유예된 과제의 실행 시점이 됐는지 판단하고, 사용자 의도 유지와 잠재적 환경 변화 모니터링까지 평가한다. 최신 LLM 8종을 8가지 에이전트 구성으로 비교한 결과 모든 설정에서 어려웠으며, 최고 성적인 GPT-5.4 에이전트도 F1 65.1%에 그쳤다. 전향 기억을 개선하는 단일 전략이 모델 전반을 지배하지도 않았다. '나중에 X 해줘'류 지시를 믿고 맡기기엔 현재 에이전트가 불안정함을 보여주는 결과로, 진단과 개입 개발용 통제 테스트베드로 공개됐다.
- •미래 시점·조건에서 의도를 실행하는 전향 기억을 측정하는 최초급 벤치마크 PM-Bench 공개
- •인지과학 Virtual Week 패러다임 기반 — 시뮬레이션 7일간 진행 중 활동과 유예 과제 실행을 병행 평가
- •최신 LLM 8종×8가지 에이전트 구성 비교에서 최고 성적(GPT-5.4)도 F1 65.1%에 그침
- •전향 기억 개선 전략 중 모든 모델에서 우위인 단일 방법은 부재
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PM-Bench: Evaluating Prospective Memory in LLM Agents
- 1.LLM 에이전트의 미래계획기억(prospective memory) 측정 벤치마크 PM-Bench 공개
- 2.인지과학 Virtual Week 패러다임 차용, 가상 7일간 진행 중 지연 과제 실행 평가
- 3.최신 LLM 8종·에이전트 구성 8종 비교, 최고 GPT-5.4 에이전트도 F1 65.1%에 그침
- 4.미래계획기억 개선 전략 중 모든 모델에서 우수한 단일 방법은 없음
왜 중요한가?
'나중에 조건이 되면 이걸 해라'는 지시를 유지·실행하는 능력은 개인 비서·자동화 에이전트의 신뢰성에 직결되는데, 최상위 모델조차 F1 65%에 그친다는 결과는 장기 실행 에이전트 배포 전에 반드시 점검해야 할 약점을 드러낸다.
PM-Bench는 LLM 에이전트의 '예정 기억' 능력을 평가하는 벤치마크로, 미래 특정 시점에 의도를 실행하는 능력을 측정합니다. 한국에서 고도화된 대화형 AI 및 에이전트 시스템 개발이 활발해지는 만큼, 이 벤치마크는 더욱 신뢰성 높고 인간 친화적인 AI 에이전트를 구축하는 데 핵심적인 평가 기준을 제공할 것입니다.
본문 미리보기
arXiv:2607.12385v1 Announce Type: new Abstract: A significant challenge in agentic AI is prospective memory: the ability to execute an intention at a specific future cue or state while other activities are ongoing. We introduce PM-Bench, a text-based benchmark for measuring prospective memory capabilities in modern LLM agents. Inspired by the Virtual Week paradigm from cognitive science, PM-Bench evaluates how well LLM agents maintain user intentions, execute delayed intentions, and monitor lat
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

