의료 진단을 '반복적 증거 탐색 과제'로 형식화하고, 검증 가능한 보상 기반 강화학습(RLVR)으로 LLM이 능동적으로 증거를 수집하며 진단하도록 훈련한 연구다. 완전한 정보를 전제로 한 수동적 추론에 머무는 기존 추론 LLM과 달리, 진단 정밀도와 검사 일관성을 강제하는 보상 체계로 폐루프 환경에서 내재적 추론을 이끌어낸다. 이를 위해 현실적이고 지식에 기반한 후속 검사 결과를 제공하는 RAG 기반 검사 시뮬레이터 RAGES를 함께 개발했다. 다양한 데이터셋에서 제안 모델이 더 크고 추론이 강화된 베이스라인과 대등한 성능을 보였고, RAGES는 일반 LLM보다 생물학적으로 타당한 임상 피드백을 생성했다. LLM을 수동 응답자에서 자율적 진단 보조자로 전환할 수 있음을 보여준다.
- •의료 진단을 전략적 증거 획득이 필요한 반복적 증거 탐색 과제로 형식화
- •진단 정밀도와 검사 일관성을 강제하는 보상 체계로 RLVR 학습 수행
- •RAG 기반 고충실도 임상 검사 시뮬레이터 RAGES 개발, 일반 LLM보다 생물학적으로 타당한 피드백 생성
- •더 크고 추론 강화된 베이스라인과 대등한 진단 성능 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models
- 1.의료 진단을 '반복적 증거 탐색 과제'로 정식화, 검증 가능 보상 강화학습(RLVR)으로 능동 추론 유도
- 2.RAG 기반 검사 시뮬레이터 RAGES가 지식 기반의 현실적 후속 검사 결과 제공
- 3.더 크고 추론 강화된 베이스라인과 대등한 성능, RAGES는 일반 LLM보다 생물학적으로 타당한 피드백 생성
왜 중요한가?
완전 정보를 가정하는 기존 의료 LLM과 달리 실제 임상처럼 검사를 전략적으로 요청하며 증거를 모으는 능동 진단으로 전환한 점이 핵심으로, 임상 의사결정 지원 도구가 수동 응답기에서 자율 보조자로 바뀌는 설계 방향을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2607.02983v1 Announce Type: new Abstract: Recent reasoning-centric Large Language Models (LLMs) have made significant strides, yet they predominantly operate on a passive-inference pattern that assumes complete information. In contrast, real-world clinical intelligence is inherently an iterative investigative process requiring strategic evidence acquisition. To bridge this gap, we formalize medical diagnosis as an Iterative Evidence-Seeking Task. We leverage Reinforcement Learning with Ve
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

