LUNAR는 의류·음식·주거·이동 등 일상 전 영역에 걸친 장기 앱 사용 이력을 바탕으로 LLM이 응답을 얼마나 개인화하는지 평가하는 최초의 벤치마크다. 데이터 희소성과 프라이버시 문제를 완화하면서도 확장 가능한 벤치마크를 구축하기 위해 실제 행동 패턴에 기반한 다단계 조대-정밀 합성 파이프라인을 사용했으며, 충실도 분석에서 기존 합성 벤치마크보다 실제 행동 분포에 더 근접함을 보였다. 19개 주요 LLM 실험 결과, 행동 로그에 대한 접근은 필요조건일 뿐 충분조건은 아니어서 더 많은 맥락이나 더 큰 모델이 항상 성능을 보장하지 않았고, 효과적인 개인화는 영역 간 관련 근거를 선별·통합하는 능력에 달려 있었다. 세밀한 행동 기록을 직접 검색하는 방식이 압축된 메모리보다 일관되게 우수했으나, 개인화 강화가 프라이버시 보호를 희생할 수 있다는 점도 드러났다.
- •의류·음식·주거·이동 등 범영역 장기 행동 로그 기반 개인화를 평가하는 최초 벤치마크
- •실제 행동 패턴 기반 다단계 조대-정밀 합성 파이프라인으로 데이터 확보
- •19개 LLM 실험: 더 많은 맥락·더 큰 모델이 개인화 성능을 보장하지 않음
- •세밀한 행동 기록 직접 검색이 압축 메모리보다 일관되게 우수
- •개인화 강화가 프라이버시 보호와 상충할 수 있음을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs
본문 미리보기
arXiv:2608.05246v1 Announce Type: new Abstract: Existing personalized LLM benchmarks primarily rely on textual personas or isolated behavioral signals, providing limited evaluation of cross-domain behavioral personalization, where responses must be grounded in heterogeneous daily-life activities. To address this gap, we introduce LUNAR, the first benchmark for evaluating how LLMs personalize responses from longitudinal app interaction histories across universal daily-life domains, including clo
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

