대규모 언어모델(LLM) 평가가 모든 사용자의 선호를 평균 내는 집계 방식에 의존해 개인의 선호를 간과한다고 지적하고, 개인화된 LLM 벤치마크의 필요성을 주장한다. Chatbot Arena 활성 사용자 115명을 대상으로 ELO와 Bradley-Terry 계수로 개인 순위를 산출했더니, BT 상관이 평균 ρ=0.04(57%가 영·음의 상관), ELO는 ρ=0.43에 그쳤다. 사용자별 주제 관심사와 글쓰기 스타일이 모델 선호에 큰 영향을 주었으며, 주제·스타일 특징의 결합이 개인별 순위 예측에 유용한 특성 공간을 제공함을 보였다.
- •집계 벤치마크가 대다수 사용자의 개인 선호를 근사하지 못함을 실증
- •115명 사용자의 ELO·Bradley-Terry 순위로 개인화 순위를 산출
- •개인-집계 순위 상관이 매우 낮은 수준으로 일관되게 나타남
- •주제·스타일 특징 조합이 개인별 선호 예측의 핵심 신호 제공
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Personalized Benchmarking: Evaluating LLMs by Individual Preferences
- 1.Chatbot Arena 실사용자 115명 데이터로 개인화 LLM 순위의 필요성 입증
- 2.개인 선호와 집계 선호 Bradley-Terry 상관은 평균 0.04로 매우 낮음
- 3.토픽 및 문체 특징이 사용자별 모델 순위에 강한 영향
- 4.개인화 벤치마크가 집계 순위의 한계 보완 가능성 제시
왜 중요한가?
현재 리더보드 중심 LLM 평가가 실제 사용자 선호를 담지 못함을 정량적으로 증명해 개인화 평가 체계의 필요성 강조
언급 프로젝트
본문 미리보기
arXiv:2604.18943v1 Announce Type: new Abstract: With the rise in capabilities of large language models (LLMs) and their deployment in real-world tasks, evaluating LLM alignment with human preferences has become an important challenge. Current benchmarks average preferences across all users to compute aggregate ratings, overlooking individual user preferences when establishing model rankings. Since users have varying preferences in different contexts, we call for personalized LLM benchmarks that
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

