이 논문은 LLM이 통계·데이터 과학 업무를 보조할 때, 기존 평가들이 분석 대상이 이미 명시된 상태를 가정해온 것과 달리 사용자가 비정형적 목표와 이질적인 데이터를 가지고 온 상황에서 모델이 스스로 통계 과제와 관련 데이터를 판단해야 하는 상류 단계, 즉 '통계 문제 정형화'를 다룬다. 이를 통계 문제 분류와 변수 식별·역할 할당이라는 두 하위 과제로 분해하고, 5개 학제간 통계 교재와 데이터 과학 사례집을 기반으로 20개 대분류·85개 세분류 통계 문제 유형을 아우르는 1,013개 샘플의 벤치마크 StatFormBench를 구축했다. 14개의 오픈·클로즈드소스 LLM을 평가한 결과 최고 성능 제로샷 모델조차 세분류 분류 정확도 72.0%, 변수 집합 일치율 63.2%에 그쳤으며, 두 하위 과제 모두에서 일관되게 최고 성능을 보이는 모델은 없었고 프롬프팅 개선 전략의 효과도 제한적이거나 일관되지 않았다.
- •LLM이 비정형 목표에서 통계 과제와 관련 변수를 스스로 판단하는 '통계 문제 정형화' 단계를 새롭게 정의했다.
- •이를 통계 문제 분류, 변수 식별·역할 할당 두 하위 과제로 분해했다.
- •5개 통계 교재와 데이터 과학 사례집 기반 1,013개 샘플, 85개 세분류 벤치마크 StatFormBench를 구축했다.
- •14개 LLM 중 최고 제로샷 모델도 세분류 정확도 72.0%, 변수 일치율 63.2%에 그쳤다.
- •두 하위 과제 모두에서 일관되게 우수한 모델은 없었고 프롬프팅 개선 효과도 제한적이었다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Benchmarking Language Models for Statistical Problem Formulation
- 1.통계 문제 정형화를 '문제 분류'와 '변수 식별·역할 할당' 두 하위 과제로 정식화
- 2.StatFormBench 공개: 교재 5권·사례집 기반, 20개 대분류·85개 세분류 1,013개 샘플
- 3.14개 LLM 평가서 최고 모델도 세분류 정확도 72.0%, 변수 집합 일치도 63.2%에 그침
- 4.프롬프트 개선 전략 효과는 제한적이거나 비일관적, 벤치마크·코드는 HF·GitHub 공개
왜 중요한가?
실제 사용자는 분석 목표를 명확히 지정하지 않는 경우가 많은데, 이 상류 단계를 벤치마크화해 LLM 데이터 분석 어시스턴트의 실전 신뢰도 격차를 드러낸다.
언급 프로젝트
본문 미리보기
arXiv:2609.01982v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly used as assistants for statistical and data science work, yet existing evaluations largely assume the analysis target is already specified. In practice, users arrive with informal goals and heterogeneous data, leaving the model to decide what statistical task is implied and which data are relevant. We first formalize this upstream step as Statistical Problem Formulation and decompose it into two subtas
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
