LLM이 텍스트 처리기에서 자율 에이전트로 전환되는 시점에서 임바디드 다중 에이전트의 사회적 추론 평가가 중요해졌다. SocialGrid는 Among Us에서 영감을 받은 환경으로 LLM 에이전트의 플래닝·실행·사회적 추론을 평가. GPT-OSS-120B(최강 오픈 모델)도 태스크 완수·플래닝 60% 미만, 반복 행동 루프나 기본 장애물 통과 실패. Planning Oracle로 플래닝 결손과 사회적 추론을 분리하면 사회적 추론이 여전히 병목(속임수 감지는 스케일과 무관하게 거의 랜덤). 자동 실패 분석 + Elo 레이팅 리더보드 제공.
- •Among Us 영감 멀티 에이전트 환경 SocialGrid
- •최강 오픈 모델 GPT-OSS-120B도 60% 미만 성공률
- •플래닝 오라클로 분리해도 사회적 추론이 병목
- •속임수 감지 거의 랜덤 — 표면 휴리스틱 의존
- •Elo 레이팅 리더보드 + 자동 실패 분석 제공
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems
- 1.SocialGrid로 LLM 에이전트 사회적 추론 평가
- 2.속임수 감지 능력이 현재 모델의 근본 공백
- 3.임바디드 AI 에이전트 평가의 새 표준
왜 중요한가?
AI 에이전트가 인간·다른 AI와 협업·경쟁하는 환경에서 속임수 감지는 안전의 핵심. 현재 모델이 이 능력이 거의 없다는 사실은 배포 신뢰성에 큰 경고.
언급 프로젝트
본문 미리보기
arXiv:2604.16022v1 Announce Type: new Abstract: As Large Language Models (LLMs) transition from text processors to autonomous agents, evaluating their social reasoning in embodied multi-agent settings becomes critical. We introduce SocialGrid, an embodied multi-agent environment inspired by Among Us that evaluates LLM agents on planning, task execution, and social reasoning. Our evaluations reveal that even the strongest open model (GPT-OSS-120B) achieves below 60% accuracy in task completion a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:32AI 초안

