EarlyDx는 응급실 입원 시점의 제한적이고 불완전한 정보만으로 이뤄지는 조기 진단을 평가하기 위한 대규모 벤치마크로, MIMIC-IV의 응급실 환자 15만4834건을 바탕으로 구축됐다. 기존 진단 예측 벤치마크가 폐쇄형 코드셋에 한정되고 자유텍스트 기록을 배제하며 입원 전체 경과가 반영된 퇴원 진단으로 지도학습하는 한계를 극복하기 위해, 입원 시점에 확보 가능한 기록만 사용하고 응급실 재원 중 기록된 진단으로 지도학습한다. LLM 감사자가 모든 자유텍스트 라벨을 완전지지·부분지지·미지지로 검증해 완전지지 라벨만으로 평가하는 방식을 도입했다. 의미론적 LLM 평가 프로토콜에서 범용·의료특화·도메인 후속훈련 모델을 막론하고 어떤 시스템도 입원 시점 증거를 신뢰성 있게 종합하지 못했으며, 제로샷 모델은 추론이 필요한 진단의 3~31%만 회수했고 후속훈련으로도 56%에 그쳐 시간이 중요한 질환에서는 임상의 수준의 민감도·정밀도 균형에 도달한 시스템이 없었다.
- •MIMIC-IV 응급실 환자 15만4834건으로 입원 시점 조기 진단을 평가하는 벤치마크 EarlyDx를 구축했다.
- •입원 시점에 확보 가능한 기록만 쓰고 퇴원 진단이 아닌 응급실 재원 중 진단으로 지도학습한다.
- •LLM 감사자가 라벨을 완전지지·부분지지·미지지로 나눠 완전지지 라벨만 평가에 반영한다.
- •제로샷 모델은 추론 필요 진단의 3~31%만 회수했고, 후속훈련으로도 56%에 그쳐 임상의 수준에 못 미쳐다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses
본문 미리보기
arXiv:2607.28788v1 Announce Type: new Abstract: Clinical diagnosis at hospital admission must be made rapidly from limited, incomplete evidence. Existing diagnosis-prediction benchmarks are poorly suited to this setting: they restrict prediction to closed code sets, exclude free-text notes, and supervise with discharge diagnoses that incorporate the full inpatient course. We introduce EarlyDx, a large-scale benchmark for open-ended early diagnosis, built from 154,834 emergency department encoun
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:10AI 초안

