인과추론에서 성가심함수(nuisance-function) 추정기 평가에 흔히 예측오차를 쓰지만, 이것이 실제 인과추정 성능과 얼마나 일치하는지는 불확실했다. 연구진은 부분선형모델에서 몬테카를로 시뮬레이션으로 OLS, 일반화가법모델(GAM), XGBoost, XGBoost 기반 이중머신러닝(DML-XGBoost)의 예측오차, 편향, RMSE, 95% 신뢰구간 커버리지를 비교했다. XGBoost가 오라클이 아닌 방법 중 가장 낮은 RMSE를 보인 반면 DML-XGBoost는 대체로 더 나은 신뢰구간 커버리지를 제공했으며, 예측오차는 방법과 설정에 따라 인과편향과 일관되게 연관되지 않았고 점추정이 가장 좋은 방법이 반드시 신뢰구간 커버리지도 가장 좋지는 않았다. 노출·결과 성가심함수 오차의 절대 교차곱에 기반한 결합오차 지표 역시 인과편향과 약한 연관성만 보였다. 결론적으로 예측오차는 성가심함수 추정 자체를 평가하는 데는 유용하지만 최종 인과추정기 품질의 직접적 척도로 삼아서는 안 된다.
- •예측오차가 인과추정 성능을 직접 대변하지 못함을 몬테카를로 검증
- •XGBoost는 가장 낮은 RMSE, DML-XGBoost는 더 나은 신뢰구간 커버리지 확보
- •점추정 성능과 신뢰구간 커버리지 성능이 반드시 일치하지 않음
- •결합오차 지표도 인과편향과 약한 연관성만 보여 단독 지표로는 부적합
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Prediction Error Is Not Enough: Evaluating Nuisance-Function Prediction for Causal Estimation
- 1.인과추론에서 뉴이슨스 함수 추정오차와 실제 인과추정 성능 간 관계를 몬테카를로로 검증
- 2.OLS·GAM·XGBoost·DML-XGBoost 비교 결과 XGBoost가 RMSE 최저, DML-XGBoost는 CI 커버리지 우수
- 3.예측 오차는 인과 편향과 일관되게 연동되지 않았고, 점추정 최선이 CI 최선은 아니었음
- 4.결합오차 지표도 인과 편향과 약한 연관성만 보여 단독 지표로는 부적합
왜 중요한가?
머신러닝 기반 인과추론 파이프라인에서 뉴이슨스 함수의 예측 성능만 보고 최종 인과추정 신뢰도를 판단해서는 안 된다는 경고로, 실무 모델 선택 기준에 직접적인 시사점을 준다.
본문 미리보기
arXiv:2609.00071v1 Announce Type: new Abstract: Prediction error is widely used to evaluate nuisance-function estimators in causal inference, but its relationship with causal estimator performance may differ across performance measures. We studied this question in a partially linear model using Monte Carlo simulations. We compared ordinary least squares (OLS), generalized additive models (GAMs), XGBoost, and Double Machine Learning with XGBoost (DML-XGBoost), evaluating nuisance-function predic
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
