8개 도메인의 25,000회 이상 실행 결과를 토대로 LLM 기반 과학 에이전트의 추론이 과학적 자기 교정 규범을 따르는지 검증한다. 성능과 행동의 변동에서 베이스 모델이 41.4%를 설명하는 반면 스캐폴드는 1.5%에 불과해 베이스 모델이 결정적 요인이었다. 모든 구성에서 증거가 68% 빈도로 무시되었고, 반증 기반 신념 수정은 26%에 그쳤으며, 다중 증거의 수렴은 드물었다. 거의 완전한 성공 추적 컨텍스트를 줘도 같은 패턴이 지속되어, 결과 평가나 스캐폴드 엔지니어링만으로는 한계를 가짐을 보였다.
- •현재 LLM 과학 에이전트가 과학적 인식론 규범을 따르지 못함을 실증
- •베이스 모델이 성능·행동 변동의 주요 독립변수임을 정량화
- •증거 무시 68%, 반증 기반 신념 수정 26% 등 낮은 회의적 추론 떨어진 비율
- •결과 중심 평가와 스캐폴드 조정만으로는 해결 불가능함을 주장
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AI scientists produce results without reasoning scientifically
- 1.LLM 과학 에이전트 8개 도메인 25,000+ 실행에서 인식론 규범 준수 여부 검증
- 2.성능 변동의 41.4%는 베이스 모델, 1.5%만 스캐폴드로 설명
- 3.68% 트레이스에서 증거를 무시, 26%만 반증 기반 믿음 수정 발생
- 4.스캐폴드 엔지니어링만으로는 해결 불가, 추론 자체를 학습 목표로 삼아야
왜 중요한가?
자율 과학 AI가 과학적 추론 패턴을 결여함을 대규모 실증해 현행 AI 과학 결과의 타당성에 근본적 문제를 제기
본문 미리보기
arXiv:2604.18805v1 Announce Type: new Abstract: Large language model (LLM)-based systems are increasingly deployed to conduct scientific research autonomously, yet whether their reasoning adheres to the epistemic norms that make scientific inquiry self-correcting is poorly understood. Here, we evaluate LLM-based scientific agents across eight domains, spanning workflow execution to hypothesis-driven inquiry, through more than 25,000 agent runs and two complementary lenses: (i) a systematic perf
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

