현재 AI 시스템을 논문 리뷰에 활용하는 것에 반대하는 포지션 페이퍼로, ICLR 2026 리뷰를 바탕으로 인간과 AI 리뷰를 비교 분석했다. AI 리뷰어는 논문 간 과도한 합의를 보이는 집단 지성 효과와 스타일 변경만으로 점수가 조작되는 '논문 세탁' 취약성 두 가지 심각한 문제를 드러냈다. 동료 리뷰 위기 해결을 위해 범용 LLM의 즉각 배포보다 동료 리뷰 자동화의 과학적 접근이 필요하다고 주장한다.
- •AI 리뷰어는 논문 내외에서 과도하게 동의하는 집단 지성 효과로 관점 다양성을 저하시킨다.
- •LLM에게 논문을 재작성하도록 하면 AI 리뷰어 점수가 크게 올라가는 '논문 세탁' 취약성이 확인됐다.
- •비조작성과 리뷰 다양성은 자동화의 필요 조건이지만 충분 조건은 아니다.
- •동료 리뷰 위기 해결을 위해서는 엄내한 평가 없이 배포된 범용 LLM이 아닌 동료 리뷰 자동화의 과학적 접근이 필요하다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Stop Automating Peer Review Without Rigorous Evaluation
- 1.AI 리런 자동화를 엄격한 평가 없이 도입해서는 안 된다고 주장하는 포지션 페이퍼
- 2.AI 리뷰어는 하이브마인드 효과로 관점 다양성 감소, 논문 세탁으로 점수 좞게 사용되는 게임장 문제 확인
- 3.리뱰 위기에는 범용 LLM 배포가 아닌 피어 리뷰 자동화의 실퀴한 과학이 필요
왜 중요한가?
동료 심사에 LLM을 무분별하게 적용하면 리뷰 획일화와 점수 조작이 가능해져 학술 생태계를 훼손할 수 있음을 데이터로 경고하며, AI 도입에 앞서 엄격한 평가 체계를 요구한다.
본문 미리보기
arXiv:2605.03202v1 Announce Type: new Abstract: Large language models offer a tempting solution to address the peer review crisis. This position paper argues that today's AI systems should not be used to produce paper reviews. We ground this position in an empirical comparison of human- versus AI-generated ICLR 2026 reviews and an evaluation of the effect of automated paper rewriting on different AI reviewers. We identify two critical issues: 1) AI reviewers exhibit a hivemind effect of excessi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

