스탠퍼드 James Zou 팀이 AI 에이전트에 서로 다른 페르소나를 부여하면 같은 데이터·질문에서 상반된 결론을 체계적으로 도출함을 보였다. 42개 인간 연구팀이 분석한 이민 데이터 실험에서 AI 에이전트는 인간 연구자 간 이념적 효과 추정 격차의 72%를 재현했고, 상반된 결론의 보고서 86%가 AI 심사를, 78%가 인간 전문가 다수결 심사를 통과해 개별 분석의 결함으로는 문제를 식별하기 어려웠다. 문제의 본질이 잘못된 분석이 아니라 '방어 가능한 분석 공간에서의 선택적 탐색·보고'임을 지적하며, 분석 경로 분포에서 보고된 주장의 극단성을 측정하는 m-value와 이를 추정하는 Agentic Bootstrap을 제안했다. 인간 이민 연구 분석의 13.5%가 가장 극단적인 5% 구간(m<0.05)에 해당했다. AI가 p-해킹식 선택적 분석을 값싸게 증폭할 수 있는 시대에 과학적 신뢰성의 새 기준을 제시한다.
- •페르소나만 바꿔도 AI 에이전트가 같은 데이터에서 상반된 결론 도출, 이민 데이터 실험에서 인간 연구자 이념 격차의 72% 재현
- •상반된 결론의 보고서 86%가 AI 심사, 78%가 인간 전문가 심사 통과 — 개별 분석의 결함으로는 편향 식별 불가
- •핵심 문제는 오류가 아니라 방어 가능한 분석 공간에서의 선택적 탐색·보고이며, AI가 이를 저비용으로 증폭 가능
- •m-value 제안: 분석 경로 분포에서 보고된 주장만큼 극단적인 결과가 나올 확률 — Agentic Bootstrap으로 AI가 경로를 샘플링해 추정
- •인간 이민 연구 분석의 13.5%가 분석 공간 최극단 5% 구간(m<0.05)에 해당
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Agentic Garden of Forking Paths
- 1.AI 에이전트가 연구자들의 분석적 변동을 포착하고 숨은 경로를 명시화함을 입증
- 2.42개 인간 연구팀 이민 데이터 분석에서 AI가 이념적 격차의 72% 재현
- 3.상반된 결론의 AI 보고서 86%가 AI 검토, 78%가 전문가 검토 통과
- 4.m-값과 Agentic Bootstrap으로 분석 분포 내 극단성 정량화, 인간 분석 13.5%가 극단 5%
왜 중요한가?
동일 데이터로도 분석 선택에 따라 상반된 결론이 나오는 '갈림길 문제'를 AI가 값싸고 대규모로 증폭할 수 있음을 보이며, 단일 분석이 아니라 가능한 분석 분포 내 위치(m-값)로 과학적 신뢰성을 평가해야 한다는 기준을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2607.01507v1 Announce Type: new Abstract: Empirical research rarely admits a unique analysis. Different analytical choices can lead to different conclusions from the same data, yet these hidden forking paths are difficult to observe. We show that AI agents capture much of the analytical variation among human researchers while making these paths explicit. Across four high-stakes domains, assigning different personas is sufficient for AI agents to report divergent, often opposing, conclusio
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

