ClinLens는 장기간에 걸친 다중모달 임상 데이터를 다루는 LLM 에이전트를 평가하기 위한 환자 중심 벤치마크로, 다섯 가지 데이터 모달리티와 네 가지 분석 범위, 다섯 가지 분석 역량에 걸친 126개의 실행 가능한 과제로 구성된다. 범용·코딩·생명의학 전문 에이전트를 평가한 결과 평균 과제당 36.93단계, 8.06분이 소요됐으며, 가장 우수한 에이전트도 실행 성공률 86.4%, 최종 답변 정확도 54.0%를 기록했지만 엄격 통과율은 29.4%에 불과했다. 실패 분석에서는 환자별 에피소드 근거 확립(grounding)이 가장 빈번한 실패 원인으로 꼽혔다. 이는 환자 맥락을 일관되게 유지하며 임상 데이터를 분석하는 장기 추론 에이전트 개발에 핵심 과제를 제시한다.
- •5개 데이터 모달리티·4개 분석 범위·5개 분석 역량 포괄, 126개 실행형 과제로 구성된 벤치마크
- •최고 성능 에이전트: 실행 성공률 86.4%, 최종 답변 정확도 54.0%, 엄격 통과율 29.4%
- •과제당 평균 36.93단계, 8.06분 소요
- •환자별 에피소드 근거 확립이 가장 빈번한 실패 유형으로 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science
본문 미리보기
arXiv:2607.26155v1 Announce Type: new Abstract: Clinical data-science agents must transform heterogeneous longitudinal records into auditable analyses, yet existing benchmarks largely isolate medical question answering, structured-table reasoning, or generic scientific repositories. We introduce CLINLENS, a benchmark of 200 executable tasks over five linked MIMIC resources spanning structured electronic health records, notes, electrocardiograms, chest radiographs, and echocardiograms. A 4 x 5 t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:49AI 초안

