연구 에이전트의 실험 설명이 실제로 예측에 도움이 되는지를 측정하기 위해 개입·예측자·결과는 고정하고 설명만 바꾸는 쌍대 예측 비교 방법을 제안했다. 12개 Tox21 엔드포인트와 24개 OpenML 과제에 걸쳐 336개 사전 등록 상태를 분석한 결과 신뢰도 판정은 결론을 내리지 못했으며, Tox21과 OpenML의 사전등록 검정 모두 기준을 충족하지 못했다. 사용 모델에 따라 결과가 상반되게 나타나는 비일관성도 확인됐는데, DeepSeek V4 Pro에서는 드리프트가 줄었지만 V4 Flash 재현에서는 오차가 오히려 늘었다. 연구자가 직접 작성한 설명만이 명확한 예측 개선을 보여, 자동 생성 설명이 예측에 신뢰할 만한 도움을 준다는 명제는 아직 확증되지 않았다는 결론이다.
- •개입·예측자·결과를 고정하고 설명만 바꾸는 쌍대 예측 비교로 연구 에이전트 설명의 예측 기여도를 측정
- •Tox21·OpenML 전반에서 자동 생성 설명의 예측 정확도 기여는 통계적으로 확증되지 못함
- •사용 모델(DeepSeek V4 Pro vs Flash)에 따라 결과가 상반되게 나타나는 비일관성 확인
- •연구자가 직접 작성한 설명만이 명확한 예측 개선을 보여, 자동 설명의 가치는 아직 미확증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Predictive Credit: Measuring What Scientific Explanations Add to Experimental Forecasts
- 1.연구 에이전트의 실험 설명이 예측에 실제 도움을 주는지 측정하는 '예측 신용' 프로토콜 제안
- 2.Tox21 12개·OpenML 24개 등 336개 사례에서 설명의 예측 기여도는 결론 미확정
- 3.DeepSeek V4 Pro 사용 시 매칭·도너 카드가 Tox21 2차 변동을 64.5%·59.1% 감소
- 4.DeepSeek V4 Flash 재현 시 매칭 포인트 MAE가 0.01823→0.02020으로 오히려 악화
왜 중요한가?
설명 첨부가 예측력을 실제로 높이는지에 대한 엄격한 통제 실험으로, 연구 에이전트의 '설명 신뢰도' 주장을 검증할 기준을 제공한다.
본문 미리보기
arXiv:2610.00314v1 Announce Type: new Abstract: Research agents explain planned experiments. We measure predictive credit with paired forecasts sharing an intervention, forecaster, and outcome while varying description, matched explanation, and donor context. Five checks track commitment, delivery, predictive gain, alignment, and known-signal uptake. Across 336 prospective states in controlled learning, 12 Tox21 endpoints, and 24 OpenML tasks, v5's frozen credit decision was inconclusive. Tox21
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

