MedEvoEval은 의사 에이전트가 경험을 통해 실제로 개선·전이·유지되는지를 측정하는 실행 가능한 종단적 평가 프레임워크다. 완전한 입력에서 최종 답만 채점하는 고정 입력 의료 QA나 개별 진료에 머무는 기존 상호작용 벤치마크와 달리, 행동으로만 근거가 공개되는 행동 게이트 외래 에피소드를 기반으로 한다. 각 원본 사례를 환자·검사·관리자 역할별 뷰로 변환하고, 관찰·행동·최종 출력·관리자 점수·선택적 경험 재기록을 잇는 구조화된 트레이스를 기록한다. 저자는 700개 처리 에피소드와 에피소드 러너, 채점 스크립트, 예시 로그, 분석 코드를 포함한 실행형 아티팩트를 공개했다. 실험은 에피소드 트레이스가 최종 답 채점이 감추는 과정 비용을 드러내고, MDT식 협진이 자원을 재배분하는 양상과 기억 성숙·홀드아웃 전이·업데이트 반응·후향 보존을 분석할 수 있음을 보였다.
- •행동으로만 근거가 공개되는 행동 게이트 외래 에피소드 기반 종단적 평가 프레임워크
- •환자·검사·관리자 역할별 뷰와 관찰-행동-출력-점수를 잇는 구조화 트레이스 기록
- •700개 처리 에피소드와 실행 러너·채점 스크립트를 포함한 실행형 아티팩트 공개
- •최종 답 채점이 감추는 과정 비용을 드러내고 기억 성숙·전이·보존 종단 분석 지원
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MedEvoEval: Evaluating Continual Evolution of Doctor Agents through Simulated Clinical Episodes
- 1.MedEvoEval 공개: 외래 에피소드 시뮬레이션으로 의사 에이전트의 '지속 진화'를 평가하는 종단 프레임워크
- 2.증거는 유효 행동을 통해서만 공개(action-gated), 환자·검사·관리자 역할별 뷰로 케이스 변환
- 3.700개 처리 에피소드와 러너·채점 스크립트·분석 코드를 실행 가능한 아티팩트로 공개
- 4.최종 답안 채점이 감추던 과정 비용을 드러내고 메모리 성숙·전이·유지 등 종단 분석 지원 입증
왜 중요한가?
의료 QA 평가가 '한 번의 정답'에서 '경험을 통한 개선·전이·역행 방지'라는 시간 축으로 확장됐다는 점이 핵심이다. 메모리·반성 메커니즘을 갖춘 에이전트가 실제로 회차를 거듭하며 나아지는지 검증할 실행 가능한 기반을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2606.28900v1 Announce Type: new Abstract: Doctor agents are moving beyond single-turn answer generation toward evolving clinical decision systems. Within an outpatient episode, they acquire evidence, use examination and consultation resources, and decide when to finalize a diagnosis and management plan. Across episodes, their behavior may change through memory, retrieval, reflection, or other update mechanisms. Current evaluations only partially cover this setting. Fixed-input medical QA
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

