KNOWSIM은 사용자의 지식 수준에 맞춰 정보를 조율하는 LLM의 '정보 보정' 능력을 평가하기 위한 사용자 시뮬레이터 프레임워크다. 선수관계로 연결된 정보 단위 그래프로 사용자의 지식 상태를 명시적으로 표현하고, 학습이론에 기반한 갱신 규칙에 따라 이 상태를 변화시킨다. 지식 습득량, 전달 보정도, 인지 과부하라는 세 지표를 지식 상태 궤적에서 직접 계산하며, 두 도메인 705건의 실제 인간-AI 세션과 비교한 결과 인간 판단과 73~74% 부호 일치율을 보여 기존 3개 베이스라인 시뮬레이터보다 우수했다. 9개 LLM에 적용한 결과 사용자의 지식 수준에 따라 최적 모델이 달라지는, 표준 평가로는 보이지 않던 상호작용이 드러났다.
- •사용자 지식 상태를 정보 단위 그래프로 명시적으로 모델링하는 사용자 시뮬레이터
- •지식 습득량·전달 보정도·인지 과부하 3개 지표를 지식 교적에서 직접 계산
- •705건 실제 세션 비교서 인간 판단과 73~74% 일치, 기존 시뮬레이터 능가
- •9개 LLM 평가서 사용자 지식 수준별 최적 모델이 달라지는 상호작용 발견
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn
- 1.KNOWSIM 제안, 사용자 지식 상태를 명시적으로 모델링하는 LLM 평가용 사용자 시뮬레이터
- 2.지식을 선행조건 관계를 가진 정보단위 그래프로 표현, 학습이론 기반 규칙으로 진화
- 3.지식획득·전달보정·인지과부하 3가지 지표를 상태 궤적으로 직접 계산
- 4.705건 인간-AI 세션 검증에서 인간 판단과 73~74% 부호일치, 기존 시뮬레이터 3종 능가
왜 중요한가?
기존 사용자 시뮬레이터가 지식 수준 변화를 반영하지 못해 LLM 평가·학습에 비현실적이었던 한계를 극복, 9개 LLM 적용 결과 사용자 지식 수준에 따라 최적 모델이 달라지는 현상까지 드러내 표준 평가로는 볼 수 없던 상호작용을 포착한다.
언급 프로젝트
본문 미리보기
arXiv:2608.17150v1 Announce Type: new Abstract: To effectively collaborate with users on knowledge-intensive tasks, Large Language Models (LLMs) must perform information calibration: matching content to a user's evolving understanding and cognitive capacity. Yet user simulators used to evaluate and train LLMs do not explicitly model user knowledge so they neither produce realistic interactions across knowledge levels nor reflect how interactions unfold as that knowledge evolves. To close this g
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
