BayesBench는 멀티턴 대화에서 LLM의 신념 업데이트가 합리적 베이지안 추론자와 얼마나 일치하는지 측정하는 시뮬레이션 벤치마크다. 순차 증거로 미지 파라미터를 추정하는 베이지안 추정, 잠재 변수에 대한 신념을 결과 예측으로 전환하는 베이지안 예측, 사용자 페르소나 프레임을 거친 관측에서 잠재 상태와 페르소나를 동시에 추론하는 과제까지 난이도가 점증하는 3개 태스크로 구성된다. 3B~70B 규모 LLM 7개를 평가한 결과, 모델이 커질수록 잠재 추론과 증거 축적이 개선돼 때로는 베이지안 사후분포에 근접했지만, 이 향상이 다운스트림 예측으로는 안정적으로 이어지지 않았다. 잠재 구조를 추론하는 능력과 이를 활용해 결과 신념을 합리적으로 갱신하는 능력 사이의 간극을 드러내며, 최종 답변만 채점하는 기존 평가의 한계를 보완한다.
- •멀티턴 증거 축적 상황에서 LLM 신념 궤적을 베이지안 기준과 비교하는 BayesBench 제안
- •베이지안 추정·예측·페르소나 프레임 예측의 난이도 점증 3개 태스크 구성
- •3B~70B 모델 7개 평가: 규모 확대로 잠재 추론 개선, 때로 베이지안 사후분포에 근접
- •잠재 구조 추론 향상이 다운스트림 예측 개선으로 안정적으로 이어지지 않는 간극 발견
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation
- 1.BayesBench 공개: 멀티턴 대화에서 LLM의 믿음 갱신이 베이지안 추론자와 얼마나 일치하는지 측정
- 2.베이지안 추정→예측→페르소나 프레임 예측의 3단계 난이도 시뮬레이션 환경으로 구성
- 3.3B~70B 7개 모델에서 스케일이 커질수록 잠재변수 추론·증거 누적은 개선, 때로 베이지안 사후확률 수준
- 4.하지만 잠재 구조 추론 능력이 하단 예측의 합리적 믿음 갱신으로는 이어지지 않는 격차 확인
왜 중요한가?
대부분의 벤치마크가 마지막 턴 정답만 채점하는 것과 달리, 대화가 진행되며 증거가 쌓일 때 믿음이 어떻게 변하는지 그 '궤적' 자체를 평가한다는 점이 새롭다. 추론은 잘하지만 그것을 예측에 활용하지 못하는 격차는 에이전트의 다회차 의사결정 신뢰성에 직접적 한계로 작용한다.
언급 프로젝트
본문 미리보기
arXiv:2606.30850v1 Announce Type: new Abstract: Large language models (LLMs) are typically deployed in multi-turn conversations, where each turn provides new evidence that should reduce epistemic uncertainty about their environment. Acting rationally then requires inferring the unobserved quantities that govern it and updating beliefs about them as evidence accumulates. Yet most evaluations only score the model's final-turn answer in a single-turn format, leaving this process unexamined. We ask
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

