이 연구는 대규모 표준화 시험 프로그램의 과거 항목 탈락 데이터를 활용해, 전문가 수작업 검토나 현장 테스트 없이 시험 문항의 채택·탈락을 예측하는 자동 항목 평가(AIE) 모델을 구축했다. 영어 언어예술(ELA)·수학 문항 52,759개(34%가 영구 탈락) 데이터로 원문 텍스트를 학습한 DeBERTaV3-large 분류기, Qwen3가 생성한 문항 비평을 학습한 분류기, 두 표현을 결합한 융합 모델을 각각 학습시켰다. 융합 모델이 가장 우수했으며(정확도 .75, F1 .64, AUC .80), 수학(F1 .73, AUC .86)이 ELA(F1 .51, AUC .72)보다 훨씬 정확하게 예측됐고, 결정 임계값을 .5에서 .25로 낮추면 ELA·수학의 평균 민감도가 각각 .88·.91로 높아졌다. 다만 융합 모델은 편향·민감성·공정성·접근성 문제로 플래그된 문항, 특히 ELA에서는 이를 잘 식별하지 못해 해당 영역은 여전히 사람의 검토가 중요함을 보여준다.
- •52,759개 실제 시험 문항의 탈락 이력으로 자동 항목 평가 모델 구축
- •원문 텍스트와 LLM 생성 비평을 결합한 융합 모델이 최고 성능(F1 .64, AUC .80)
- •수학 예측이 ELA보다 훨씨 정확(F1 .73 vs .51)
- •공정성·편향 관련 탈락 문항은 잘 식별하지 못해 사람 검토 필요성 강조
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Automated item evaluation: Predicting item acceptance and rejection using LLM-generated critiques
본문 미리보기
arXiv:2608.06609v1 Announce Type: new Abstract: Automated item evaluation (AIE) refers to the use of computational methods to assess item quality without requiring manual expert review or field testing of the items under evaluation. We aimed to build a near-comprehensive AIE model by predicting item acceptance and rejection from item text using historical rejection data from a large-scale standardized testing program. The dataset contained 52,759 English language arts (ELA) and mathematics item
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

