NormAct는 체화된(embodied) 플래너로 쓰이는 멀티모달 LLM이 명시적 지시 없이 숨은 사회적 규범을 추론해 행동 계획에 반영하는지 평가하는 벤치마크다. 일상 과제 안에 숨은 규범을 심어 목표 달성, 규범 준수, 전체 과제 성공을 측정한다. GPT-5.4, Claude Opus 4.7, Gemini 3 Pro 등 최신 모델 실험에서 명시적 목표는 67.3% 달성했지만 숨은 규범 준수는 26.4%에 그쳐 큰 격차가 드러났고, 단서 조건 실험 결과 이는 사회적 지식 부족이 아니라 맥락에서 관련 규범을 활성화·접지하지 못하는 문제였다. 계획 전에 장면 관련 규범을 추론하는 NormPerceptor를 붙이면 과제 성공률이 24.2%에서 46.7%로 올랐다. 로봇·에이전트가 실제 환경에 배치될수록 '말 안 해도 지켜야 할 것'을 감지하는 능력이 안전과 수용성의 관건임을 시사한다.
- •숨은 사회적 규범을 일상 과제에 내장해 목표 달성·규범 준수·과제 성공을 평가하는 체화형 벤치마크 NormAct 공개
- •최신 MLLM(GPT-5.4, Claude Opus 4.7, Gemini 3 Pro)은 명시적 목표 67.3% 달성 vs 숨은 규범 준수 26.4%의 큰 격차
- •단서 조건 실험: 격차의 원인은 사회적 지식 부족이 아니라 맥락 내 규범 활성화·접지의 실패
- •계획 전 장면 관련 규범을 추론하는 NormPerceptor로 과제 성공률 24.2%→46.7%로 향상
- •벤치마크는 공개되어 후속 연구에서 활용 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
NormAct: A Benchmark for Hidden Social Norm Compliance in Embodied Planning
- 1.체화 플래닝의 숨은 사회규범 준수를 평가하는 벤치마크 NormAct 공개
- 2.GPT-5.4·Claude Opus 4.7·Gemini 3 Pro: 명시 목표 67.3% vs 규범 준수 26.4%
- 3.격차는 지식 부족이 아닌 맥락 내 규범 활성화·접지 실패에서 기인
- 4.사전 규범 단서 생성기 NormPerceptor로 과제 성공률 24.2%→46.7% 향상
왜 중요한가?
최신 MLLM들이 명시적 목표는 67.3% 달성해도 암묵적 사회규범은 26.4%만 지킨다는 격차를 정량화하고, 사전 규범 단서 생성만으로 성공률을 두 배 가까이 끌어올려 체화 에이전트의 규범 접지 중요성을 보였다.
본문 미리보기
arXiv:2606.27826v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) are increasingly deployed as embodied planners in egocentric environments, where task success requires not only achieving instructed goals but also acting in socially appropriate ways. While explicit goals may render certain actions optimal, implicit social norms often impose hidden constraints. Existing evaluations typically focus on explicit goal achievement or direct norm knowledge, seldom assessing whet
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

