이 논문은 LLM의 도덕 판단이 인간과 표면적으로 일치하더라도 근본적인 도덕적 근거까지 같은 것은 아니라고 주장한다. 연구진은 ETHICS 데이터셋 기반 500개 항목 벤치마크에서 최종 판단뿐 아니라 그 근거(rationale)까지 인간 주석자와 LLM 모두에게서 새로 수집해 비교했다. 프론티어 모델과 오픈소스 모델 모두 최종 라벨 일치율은 높았지만, 근거 수준에서는 해악·존중·약속이행·정의·응분·면책 등 범주에 걸쳐 인간과 체계적으로 다른 비중을 두는 것으로 나타났다. 저자들은 라벨 일치만으로 정렬(alignment)을 판단하면 오해를 부를 수 있으며, 판단의 이유와 원칙까지 함께 분석해야 한다고 강조한다.
- •500개 항목 ETHICS 기반 벤치마크로 인간·LLM의 최종 라벨과 근거를 모두 새로 수집·비교
- •프론티어·오픈소스 모델 모두 인간 다수 라벨과의 일치율은 대체로 높음
- •근거 수준에서는 해악·존중·정의 등 범주별 비중이 인간과 체계적으로 다름
- •최종 판단이 같아도 근거가 다른 경우가 다수 확인됨
- •라벨 일치를 정렬과 동일시하면 오도될 수 있어 근거 분석 병행 필요
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments
- 1.500개 ETHICS 기반 벤치마크서 LLM·인간 도덕판단 라벨 일치도는 높지만 근거는 체계적으로 다름 확인
- 2.모델은 해악·존중·약속이행·정의 등 범주 주의를 인간과 다르게 재배분, 라벨 같아도 근거는 상이
- 3.라벨 기준 평가만으로는 정렬 여부 오도 가능, 근거·원칙 분석 병행 필요함을 주장
왜 중요한가?
LLM의 도덕적 정렬을 평가할 때 흔히 쓰이는 인간과 같은 결론을 내리는가라는 기준이, 실제로는 서로 다른 도덕적 근거에서 우연히 같은 결론에 도달한 경우를 정렬로 오인하게 만들 수 있음을 보여, 정렬 평가 방법론 자체의 재검토를 요구한다.
본문 미리보기
arXiv:2608.12368v1 Announce Type: new Abstract: Agreement with human judgments is a common proxy for evaluating the alignment of large language models (LLMs). Yet agreement in final labels does not show that human annotators and models rely on the same moral grounds. Two agents may reach the same judgment while appealing to different principles, contextual assumptions, or interpretations of the situation. We test this distinction using a curated 500-item ETHICS-derived benchmark spanning five
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

