LLM 에이전트는 메모리 검색, 도구 호출, 확인 질문, 응답 스타일 변화 등을 수행할 수 있지만, 이런 실행 결정을 개별 사용자에 맞게 적응시키기는 어렵다. 별도 LLM을 파인튜닝하는 것은 비용이 크거나 독점 시스템에서는 불가능하며, 프롬프트와 메모리는 에이전트에 사용자 정보를 노출할 뿐 피드백으로부터 실행 결정을 적응시키지는 못한다. 이 논문은 고정된(frozen) 에이전트의 개인화를, 실행된 행동에 대해서만 관찰되는 스칼라 피드백으로부터 사용자별 실행 정책을 온라인 학습하는 문제로 정식화하고, 블랙박스일 수 있는 호스트 에이전트 바깥에 경량 정책 레이어로 얹는 FABLE(Factorized Adaptive Bandit Layer for Execution)을 제안한다. FABLE은 메모리·정보 획득·응답 결정을 분해해 관련 선택에만 피드백을 반영하고, 탐색에 앞서 외부에서 지정한 실행 가능 집합으로 행동을 걸러내며, 베이지안 맥락적 톰슨 샘플링으로 고정된 기본값·비용 점수 대비 사용자별 잔차 선호를 학습한다. 선형 잔차-보상 모델 하에서 보정된 변형은 최적의 실행 가능 행동 대비 기대 후회 경계를 상속하며, 개인화 추론·통제된 피드백·실행 가능한 도구 사용 평가 전반에서 FABLE은 규칙 기반 대조군 대비 선호 민감 행동을 개선하면서도 종단간 작업 성능에서도 경쟁력을 유지했다.
- •LLM 에이전트 개인화를 실행된 행동에 대한 스칼라 피드백만으로 학습하는 온라인 학습 문제로 정식화
- •블랙박스 호스트 에이전트 밖에 얻는 경량 정책 레이어 FABLE 제안
- •메모리·정보 획득·응답 결정을 분해하고 실행 가능 집합으로 사전 필터링
- •베이지안 맥락적 토슨 샘플링으로 사용자별 잔차 선호 학습, 선형 모델 하 기대 후회 경계 보유
- •개인화 추론·통제 피드백·도구 사용 평가에서 규칙 기반 대조군 대비 선호 민감 행동 개선, 작업 성능도 경쟁력 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Personalizing Large Language Model Agents with Small Policy Models
본문 미리보기
arXiv:2608.00215v1 Announce Type: new Abstract: Large language model (LLM) agents can retrieve memory, call tools, ask clarifying questions, and vary response style, yet adapting these execution decisions to an individual user remains difficult. Fine-tuning a separate LLM is costly or impossible for proprietary systems, while prompts and memory primarily expose user information to the agent rather than adapt its execution decisions from feedback. We formulate personalization of a frozen agent a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

