이 연구는 LLM의 마음 이론(ToM) 능력 향상이 실제 인간-AI 상호작용에서 얼마나 도움이 되는지를 처음으로 체계적으로 실증 평가한다. 기존 벤치마크가 3인칭 관점 객관식에 의존하는 것과 달리 1인칭 동적 개방형 상호작용에 초점을 맞춘 새로운 대화형 ToM 평가 패러다임을 제안했다. 코딩·수학 등 목표 지향 과제와 상담 등 경험 지향 과제 모두에서 정적 벤치마크 개선이 동적 HAI 상호작용 성능 향상으로 항상 이어지지 않는다는 사실을 발견했다. 차세대 사회 인식 AI 개발을 위해 상호작용 기반 평가의 필요성을 강조한다.
- •기존 정적 ToM 벤치마크의 개선이 동적 인간-AI 상호작용 성능 향상으로 항상 이어지지 않는다.
- •1인칭 동적 개방형 상호작용에 초점을 맞춰 새로운 대화형 ToM 평가 패러다임을 제안했다.
- •목표 지향 및 경험 지향 과제 모두에서 네 가지 대표적 ToM 향상 기법을 실증 평가했다.
- •사회적으로 인식하는 LLM 개발에는 상호작용 기반 평가가 필수적임을 강조한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Does Theory of Mind Improvement Really Benefit Human-AI Interactions? Empirical Findings from Interactive Evaluations
- 1.ToM 향상 기법이 정적 벤치마크에서는 개선되나 실제 동적 인간-AI 상호작용에서는 항상 효과적이지 않음
- 2.코딩·수학(목표 지향)과 상담(경험 지향) 4개 실제 데이터셋과 사용자 연구로 4가지 기법 평가
- 3.1인칭 관점의 상호작용 기반 ToM 평가 패러다임 제안으로 평가 방식 전환 촉구
- 4.정적 벤치마크 성능과 실제 상호작용 성능 간의 괴리를 실험으로 확인
왜 중요한가?
LLM의 사회적 지능 향상을 위한 ToM 연구가 실제 사용자 상호작용 효과로 이어지지 않을 수 있음을 보여주어, AI 평가 방식의 근본적 재검토를 촉구하는 중요한 연구다.
본문 미리보기
arXiv:2605.15205v1 Announce Type: new Abstract: Improving the Theory of Mind (ToM) capability of Large Language Models (LLMs) is crucial for effective social interactions between these AI models and humans. However, the existing benchmarks often measure ToM capability improvement through story-reading, multiple-choice questions from a third-person perspective, while ignoring the first-person, dynamic, and open-ended nature of human-AI (HAI) interactions. To directly examine how ToM improvement
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

