LLM 에이전트가 사회과학 논문의 method description과 원본 데이터만으로 결과를 재현할 수 있는지 평가. agent reproduction 시스템 — 논문에서 구조화된 method 추출 → 코드·결과·논문 본문 비공개 상태로 재구현 → cell-level deterministic 비교 + error attribution. 4개 scaffold·4개 LLM·48개 인간 검증 논문 평가 결과 에이전트가 결과를 대부분 회복 가능하지만 모델·scaffold·논문별 격차 큼. Root cause 분석 결과 실패는 에이전트 오류와 논문 자체 underspecification 모두에서 발생.
- •LLM 에이전트가 social science 논문의 method description+데이터만으로 재현 가능한지 평가.
- •재구현 시 코드·결과·논문 본문 비공개 — 정보 격리 엄격 유지.
- •Cell-level deterministic 비교 + error attribution으로 root cause 추적.
- •4 scaffold·4 LLM·48 논문 — 결과 회복 가능하지만 격차 큼.
- •실패 원인이 에이전트 오류 + 논문 underspecification 양측에 있음을 정량 입증.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results
- 1.코드·결과 없이 논문 방법론만으로 사회과학 결과를 재현하는 에이전트 시스템 개발
- 2.엄격한 정보 격리 하에 4개 에이전트 스캐폴드·4개 LLM으로 48편 논문 평가
- 3.에이전트가 공개 결과를 대체로 재현하지만 모델·스캐폴드·논문별 성능 편차 상당
- 4.에이전트 오류와 논문의 방법론 미명세가 실패의 주요 원인으로 확인
왜 중요한가?
과학 재현 위기에 AI 에이전트를 활용하는 접근은 연구 재현성 향상에 기여할 수 있으며, 동시에 논문 작성 표준 개선 필요성도 부각시킨다.
본문 미리보기
arXiv:2604.21965v1 Announce Type: new Abstract: Recent work has used LLM agents to reproduce empirical social science results with access to both the data and code. We broaden this scope by asking: Can they reproduce results given only a paper's methods description and original data? We develop an agentic reproduction system that extracts structured methods descriptions from papers, runs reimplementations under strict information isolation -- agents never see the original code, results, or pape
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:45AI 초안

