SciLitBench는 제목·초록 스크리닝, 전문 스크리닝, 스키마 기반 데이터 추출까지 체계적 문헌고찰의 여러 단계를 하나로 아우르는 다단계 벤치마크로, 42,981건의 검색 레코드와 1,012건의 전문, 888편의 포함 논문 주석을 담고 있다. 6개 모델 계열의 오픈웨이트 LLM 22종을 평가한 결과, 명시적 포함·제외 기준을 제공하면 제목·초록 스크리닝의 F2 점수가 28.8% 향상됐고 연구자가 작성한 근거 설명은 전문 스크리닝을 15% 개선시켰다. 반면 데이터 추출 단계는 전혀 다른 신뢰도 양상을 보여, 출판연도 추출 정확도는 0.97에 달했지만 계산적 접근법 추출의 자카드 중복도는 0.37에 그쳤고 최고 성능 모델도 주석된 평가 근거의 30%, 한계점의 25%만 회수했다. 이는 고재현율 스크리닝과 증거 완결적 추출 사이에 실질적인 경계가 존재함을 보여준다.
- •스크리닝부터 데이터 추출까지 문헌고찰 전 단계를 아우르는 SciLitBench 공개(4만여 레코드)
- •명시적 포함·제외 기준 제공 시 스크리닝 F2 28.8% 향상, 근거 설명은 전문 스크리닝 15% 개선
- •데이터 추출은 항목별 편차가 커 출판연도 0.97 vs 계산적 접근법 0.37(자카드)
- •최고 성능 모델도 평가 근거 30%, 한계점 25%만 회수해 스크리닝과 완결적 추출 간 경계 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SciLitBench: Benchmark and Design Principles for LLM-Powered Systematic Literature Reviews
- 1.체계적 문헌고찰 전 단계(초록심사·전문심사·데이터추출)를 아우르는 벤치마크 'SciLitBench' 공개
- 2.검색 레코드 42,981건, 전문 1,012건, 포함논문 888건 주석으로 구성
- 3.22개 오픈웨이트 LLM 평가 결과, 명시적 포함·배제기준 제공시 초록심사 F2 28.8% 향상
- 4.데이터 추출 단계는 출판연도 정확도 0.97 대비 계산방법 추출 Jaccard 0.37로 신뢰도 격차 큼
왜 중요한가?
LLM이 문헌 고찰의 고재현율 심사 단계는 잘 수행하지만 근거 완전성이 요구되는 추출 단계에서는 한계가 뚜렷하다는 실증 경계를 제시해, 연구 보조 도구의 적용 범위를 가늠하게 한다.
언급 프로젝트
본문 미리보기
arXiv:2609.05505v1 Announce Type: new Abstract: Systematic reviews require sustained human judgment across thousands of records, yet existing evaluations of large language models (LLMs) typically examine review stages in isolation. We introduce SciLitBench, a multi-stage benchmark spanning title and abstract screening, full-text screening, and schema-guided data extraction, with 42,981 retrieved records, 1,012 full texts, and annotations for 888 included papers. Across 22 open-weight LLMs from
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

