MatrAIx는 AI 시스템과 디지털 제품을 다양한 이질적 사용자로 테스트하기 위한 인구 규모의 시뮬레이션 사용자 평가 인프라다. 핵심 요소인 Persona 8B는 1,290개 범주형 차원으로 표현된 83억 개의 페르소나 레코드를 포함하며, 사람 기반 약 60만 개와 합성 40만 개로 구성된 품질 필터링된 약 100만 개 코어셋을 공개했다. MatrAIx 플레이그라운드는 설문, AI 챗봇, 웹, 앱 등 4가지 환경을 제공하며, 상거래·소프트웨어·금융·헬스케어 등 25개 이상 도메인에 걸친 1,010개 애플리케이션 과제를 포함한다. 클로드 오퍼스 4.8, GPT 5.5, 클로드 하이쿠 4.5로 구동되는 페르소나 에이전트로 8개 대표 과제에서 18,189회의 평가 시행을 진행해 가격 인상 후 망설임, AI 실패 후 재시도 의향 등 배경별 의사결정 차이를 포착했으며, 400회 통제 연구에서 페르소나 행동 충실도가 91.5%로 나타났다.
- •MatrAIx, 83억 개 페르소나 레코드(Persona 8B)를 활용한 인구 규모 시뮬레이션 사용자 평가 인프라
- •사람 기반 약 60만·합성 40만으로 구성된 품질 필터링 100만 페르소나 코어셋 공개
- •설문·AI챗봇·웹·앱 4개 환경, 25개 이상 도메인 1,010개 애플리케이션 과제 제공
- •클로드 오퍼스 4.8·GPT 5.5·클로드 하이쿠 4.5로 구동된 페르소나 에이전트로 18,189회 평가 시행
- •400회 통제 연구에서 페르소나 행동 충실도 91.5% 달성, 인간·LLM 심사자로 추출 품질 검증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MatrAIx: Simulating the World with 8.3 Billion Persona Agents
본문 미리보기
arXiv:2608.04205v1 Announce Type: new Abstract: Human evaluation of AI systems and digital products is costly, slow, and difficult to scale. Offline evaluations are more scalable but often abstract away human diversity and interactive behavior. We therefore introduce MatrAIx, a population-scale simulated-user evaluation infrastructure for testing AI systems and digital products with heterogeneous users. MatrAIx has three core components: First, Persona 8B contains 8.3 billion persona records re
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

