이 논문은 기존 AI 정렬 연구가 '무엇이 사회적으로 용인되는가'라는 1차 규범에만 집중해온 것과 달리, 규범 위반 시 누가 어떻게 제재하는지에 대한 2차 기대인 메타규범 추론을 평가하는 프레임워크를 제시한다. 감정적 평가와 행동적 반응이라는 두 축을 따라 위반자의 자기규제 예측과 관찰자의 타인규제 예측이라는 새로운 분류 과제를 도입했으며, 450개의 규범 위반 시나리오를 성별·사회적 거리별로 사람이 직접 라벨링한 NormReact 데이터셋을 공개했다. 6개 모델을 평가한 결과 LLM들은 사람이라면 아무 조치도 없을 것으로 예상하는 상황에서도 부정적 제재를 과대예측했고, 사회적 거리가 멀어질수록 인간 판단과의 정합성이 더 떨어졌다. 갈등 조정이나 정책 시뮬레이션 등 규범에 민감한 분야에서 AI가 처벌 중심으로 왜곡된 사회상을 만들어낼 위험을 시사한다.
- •1차 규범(옥고 그릅)을 넘어 2차 기대인 메타규범(누가 어떻게 제재하나) 추론 평가 프레임워크 제안
- •450개 시나리오를 성별·사회적 거리별로 라벨링한 NormReact 데이터셋 공개
- •6개 LLM 모두 사람보다 부정적 제재를 과대예측하는 경향을 보임
- •사회적 거리가 멀어질수록 인간 판단과의 정합성이 저하돼 정책·조정 분야 활용 시 위험 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Right and Wrong: Evaluating Second-order Social Reasoning in Large Language Models
- 1.1차 사회규범을 넘어 규범위반에 대한 타인의 대응을 예측하는 메타규범 추론 평가 프레임워크 제안
- 2.위반자의 자기규제·관찰자의 타인규제 예측이라는 새로운 분류 과제 정의
- 3.450개 규범위반 시나리오를 감정·행동 반응별로 수작업 라벨링한 NormReact 데이터셋 공개
- 4.6개 LLM 모두 인간보다 가혹한 처벌을 예측하며, 사회적 거리가 멀수록 인간 판단과의 괴리 확대
왜 중요한가?
LLM이 실제보다 더 가혹한 사회적 제재를 예측하는 편향을 정량적으로 드러내, 분쟁조정·정책 시뮬레이션 등 규범 민감 영역에 AI를 적용할 때 관용과 자제를 과소평가할 위험을 경고한다.
언급 프로젝트
본문 미리보기
arXiv:2609.05437v1 Announce Type: new Abstract: Previous AI alignment efforts have focused primarily on first-order social norms -- teaching models what is socially acceptable or unacceptable (e.g., `do not steal'). However, social intelligence depends not only on norm recognition, but also on anticipating who will enforce it and how (e.g., public shame or even imprisonment). These second-order expectations, known as metanorms, govern how people respond when social rules are broken. We introduc
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

