SAVOIR는 협력 게임 이론에 기반해 다중 턴 대화의 보상 분배(credit assignment) 문제를 다루는 사회 강화학습 프레임워크다. 기대 효용(expected utility)으로 회고적 분배 대신 발화의 전략적 잠재력을 사전 평가하고, 샤플리 값으로 효율성·대칭성·한계성의 공리적 보장을 제공한다. SOTOPIA 벤치마크에서 SAVOIR로 학습한 7B 모델이 GPT-4o, Claude-3.5-Sonnet 등 폐쇄형 모델과 동등하거나 이를 능가하는 SOTA를 달성했다. 큰 추론 모델조차 일관되게 낮은 성능을 보여, 사회 지능이 분석 추론과는 질적으로 다른 능력임을 시사한다.
- •협력 게임 이론 기반의 새 사회적 보상 분배 프레임워크
- •기대 효용과 샤플리 값으로 전략적·공정성 둘 다 확보
- •SOTOPIA에서 7B 모델이 GPT-4o·Claude-3.5-Sonnet 수준 이상 달성
- •대형 추론 모델 대비 사회 지능이 독립적 역량임을 실험적으로 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution
- 1.Shapley 값 기반 사회적 강화학습 크레딧 배분 프레임워크 SAVOIR 제안
- 2.기대 효용 이동으로 회고적이 아닌 선제적 발화 가치를 평가
- 3.SOTOPIA 벤치마크에서 새 SOTA, 7B 모델이 GPT-4o·Claude-3.5-Sonnet 이상
- 4.대형 추론 모델이 일관되게 부진해 사회지능은 다른 능력임을 시사
왜 중요한가?
협력게임이론 기반의 사회지능 학습 방법으로, 소형 모델도 대형 LLM을 능가할 수 있음을 보여 새로운 RL 정렬 방향을 제시
본문 미리보기
arXiv:2604.18982v1 Announce Type: new Abstract: Social intelligence, the ability to navigate complex interpersonal interactions, presents a fundamental challenge for language agents. Training such agents via reinforcement learning requires solving the credit assignment problem: determining how individual utterances contribute to multi-turn dialogue outcomes. Existing approaches directly employ language models to distribute episode-level rewards, yielding attributions that are retrospective and
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

