정답 라벨 없이 비교 증거를 통해 사회적 이해를 학습하는 강화학습 기법 RLCE(Reinforcement Learning with Comparative Evidence)가 제안됐다. 감정, 의도, 선호, 함축적 의미처럼 모호한 사회적 판단 과제에서, 여러 후보 답변 중 어떤 것이 더 근거가 탄탄한지 증거 테스트를 생성·검증해 비교하는 방식으로 정책이 진화함에 따라 테스트도 함께 갱신된다. 감정·화용론·의사소통 의도·선호를 다루는 4개 벤치마크에서, 정답 라벨 없이 작동하는 7개 방법 중 합의 기반, LLM 심판, 루브릭 기반 보상 등을 모두 제치고 최고 성능을 기록했으며 최강 기준선 대비 최대 18.93점을 앞섰다. 정답과 오답 간 보상 변동 폭도 루브릭 기반 방법보다 컸다.
- •정답 라벨 없이 비교 증거 테스트로 사회적 이해를 학습하는 RLCE 제안
- •증거 테스트가 정책 갱신에 따라 함께 진화하는 온폴리시 설계
- •감정·화용론·의도·선호 4개 벤치마크에서 라벨 없는 7개 방법 중 최고 성능, 최대 18.93점 우위
- •정답·오답 간 보상 변동폭이 루브릭 기반 방법보다 크고, 잘못된 정책 선호를 뒤집을 수 있음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reinforcement Learning with Comparative Evidence for Social Intelligence
- 1.정답 레이블 없이 사회적 이해를 학습하는 강화학습 기법 RLCE 제안
- 2.롤아웃 그룹 내 답변을 비교하는 증거 테스트를 생성·검증해 가장 근거 있는 해석을 보상으로 사용
- 3.정서·화용·의도·선호 4개 벤치마크에서 레이블 없는 7개 기법 중 최고, 최강 베이스라인 대비 최대 18.93점 향상
- 4.정책이 생성한 오답 선호를 스스로 뒤집을 수 있고, 페어와이즈 테스트 구성과 온폴리시 진화에서 이득
왜 중요한가?
수학·코딩처럼 명확한 정답 오라클이 없는 '사회적 이해' 영역에서도 사람 라벨 없이 강화학습 신호를 만들 수 있음을 보여줘, 감정·의도 인식이 필요한 AI 응용의 학습 비용을 낮출 잠재력이 있다.
언급 프로젝트
본문 미리보기
arXiv:2610.04072v1 Announce Type: new Abstract: Developing socially intelligent AI remains heavily dependent on human-annotated data, limiting the scale and breadth of social understanding models can acquire. Methods that derive training signals from unlabeled data offer a path beyond this dependence, but social predictions lack the verification oracles available in mathematics and coding. Moreover, core social targets such as affect, intent, preference, and pragmatic meaning are often ambiguou
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

