Incognita는 과제 관련 지식이 역할별로 분리된 참여자들에게 분산되고 중요한 행동은 그들을 통해서만 가능한 '사회적 분산 과제 환경'에서 생성형 에이전트를 평가하는 Concordia 기반 프레임워크다. 평가 대상 에이전트가 사용자·전문가 엔티티에 메시지를 보내고, 전문가가 허용 가능한 작업을 중개하며, 결정론적 하위 환경이 작업을 실행하고 오프라인 평가기가 결과를 채점한다. tau-bench 리테일을 다중 엔티티 환경으로 변환한 Incognita-Retail에서 3개 모델을 18개 과제, 540회 시행으로 평가한 결과, 성공률은 0%에서 8.9%, 17.2%로 오르고 성급한 종료는 100%에서 58%까지 감소했지만 신뢰성은 여전히 낮았다. 사회적으로 분산된 환경이 지식 이끌어내기, 정보원 선택, 성급한 완료 믿음 같은 행동 특성을 성공률보다 먼저 드러낸다는 점을 보여준다.
- •지식이 역할별로 격리된 참여자에게 분산된 '사회적 분산 과제 환경' 개념 정의
- •사회적 상호작용과 접지된 실행을 분리한 Concordia 기반 프레임워크 Incognita 제안
- •tau-bench 리테일을 다중 엔티티 환경으로 변환한 Incognita-Retail로 18과제 540회 시행 평가
- •성공률 0→8.9→17.2%로 상승, 성급한 종료는 100→58%로 감소했지만 신뢰성은 여전히 낮음
- •강한 모델일수록 숨겨진 지식을 더 많이 이끌어내고 더 많은 엔티티와 접촉
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita
- 1.역할별로 지식이 분산된 '사회적 분산 과제 환경'에서 에이전트를 평가하는 Incognita 프레임워크 제안
- 2.tau-bench 리테일을 다중 엔티티 환경으로 변환한 Incognita-Retail에서 18개 과제 540회 시험
- 3.모델 성능별 성공률 0%→8.9%→17.2%, 조기 종료율 100%→58%로 개선되나 신뢰성은 여전히 낮음
- 4.강한 모델일수록 숨은 지식 유도·엔티티 접촉·실행 시도가 많지만 안정적 성공엔 미달
왜 중요한가?
실제 업무처럼 정보가 사람·역할별로 흩어져 소통 자체가 탐색이 되는 환경에서 에이전트의 능력을 측정하는 새 평가축으로, 현행 최상위 모델도 성공률 17% 수준에 그쳐 신뢰성 격차를 정량적으로 드러냈다.
본문 미리보기
arXiv:2607.02975v1 Announce Type: new Abstract: Effective agency in social environments depends on when an agent seeks knowledge, when it acts, and whether its actions are justified by acquired information. Existing grounded benchmarks provide executable actions, persistent state, and verifiable outcomes, while social simulation environments provide rich interaction among language agents. We study an evaluation setting that combines these requirements. We define socially distributed task enviro
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

