의사들이 실제 진료 현장에서 던진 질문으로 임상 AI 도구를 블라인드 평가한 대규모 연구다. 30개 전문과 의사들이 OpenEvidence 플랫폼에 제출한 실제 질문 620개(Real-POCQi)와 HealthBench 187문항을 놓고, 36개 주의 현직 의사 149명이 범용 프론티어 모델 3종(Claude Opus 4.8, Gemini 3.1 Pro, GPT-5.5)과 임상 특화 도구 OpenEvidence의 답변을 전문과 일치 채점자 방식으로 비교했다. 정확성·임상 유용성·출처 품질·검증가능성·완전성 5개 축 모두에서 특화 도구가 최고점을 받았고, 승패 격차는 25~39%포인트(p<0.001)였다. LLM 채점자는 전문가 채점자와 체계적으로 달랐지만 최고 모델 판별에는 대체로 일치했다. 평가가 실제 질문 분포와 전문가 채점을 반영해야 하며, 표적 엔지니어링이 범용 모델 대비 의미 있는 성능 향상을 만든다는 것을 보여준다. Real-POCQi는 공개 벤치마크로 배포됐다.
- •실제 진료 현장 질문 620개(Real-POCQi) 기반, 현직 의사 149명의 블라인드 비교 평가
- •임상 특화 도구 OpenEvidence가 5개 평가축 모두에서 Claude Opus 4.8·Gemini 3.1 Pro·GPT-5.5를 앞섬
- •승패 격차 25~39%포인트(p<0.001), 민감도 분석에서도 일관된 결과
- •LLM 채점자는 전문가와 체계적으로 달랐으나 최고 모델 판별에는 대체로 일치
- •Real-POCQi를 공개 벤치마크로 배포, 사전 등록된 통계 분석 코드도 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Expert Evaluation of Clinical AI Tools on Real Point-of-Care Clinical Queries
- 1.의사가 실제 진료 현장에서 던진 질문 620건(Real-POCQi)으로 임상 AI 도구를 블라인드 평가
- 2.36개 주 149명 현직 의사가 Claude Opus 4.8·Gemini 3.1 Pro·GPT-5.5와 전문도구 OpenEvidence 비교
- 3.정확성·임상 효용·출처 품질 등 5개 축 모두 전문도구 승, 승률 격차 25~39%p(p<0.001)
- 4.LLM 심사위원은 전문의 판단과 체계적으로 달랐으나 최고 모델 선정에서는 대체로 일치
왜 중요한가?
시험 문제식 벤치마크가 아닌 실제 진료 질문 분포로 프론티어 모델을 전문의가 직접 채점한 드문 대규모 연구다. 범용 모델 대비 특화 도구의 일관된 우위는 의료처럼 전문화된 도메인에서 표적 엔지니어링의 가치를 실증하며, Real-POCQi 공개로 재현도 가능하다.
본문 미리보기
arXiv:2606.28960v1 Announce Type: new Abstract: Physicians now pose millions of clinical questions to AI tools each week, yet these tools are evaluated largely on hypothetical or exam-style questions, not those actually asked in practice. We report a blinded evaluation built on 620 Real-world Point-Of-Care Queries (Real-POCQi) submitted to the OpenEvidence (OE) platform by physicians spanning 30 specialties, as well as 187 questions from HealthBench. 149 practicing physicians across 36 states m
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

