임상 프로토콜 실행 에이전트에 RL을 적용할 때의 구조적 한계를 진단한 연구다. 기존 MedAgentBench v1/v2를 감사해 아무것도 하지 않아도 41.7%가 통과되는 'silent-finish' 결함을 발견하고, 이를 8.9%로 낮춘 MAB-v3(508개 과제)를 새로 구축했다. Qwen3-8B 학습에서 20개 과제 유형 중 10개는 기본 성능 0%라 그래디언트가 발생하지 않는 '능력 천장'과, 탐색으로는 발견 불가능한 정확한 임상 코드가 필요한 '형식 지식 장벽'을 확인했다. 순수 RL은 pass@1 18.2%로 규칙 기반 SFT의 34.1%에 15.9%p 뒤졌으며, 결정/형식지식/조회 분류 체계로 'SFT로 코드 주입, RL로 조건 논리 학습'이라는 처방을 제시했다. 의료 등 고신뢰 도메인에서 RL 만능론에 대한 경고다.
- •MedAgentBench v1/v2에서 무행동이 41.7% 통과되는 silent-finish 결함 발견, 천장을 8.9%로 낮춘 MAB-v3(508개 과제) 구축
- •능력 천장: 20개 과제 유형 중 10개는 기본 성능 0%라 RL 그래디언트가 아예 발생하지 않음
- •형식 지식 장벽: 3개 유형은 탐색으로 발견 불가능한 정확한 임상 코드 필요
- •순수 RL 18.2% vs 규칙 기반 SFT 34.1% (pass@1) — 15.9%p 격차가 두 장벽에서 기인
- •결정/형식지식/조회 분류체계로 RL 학습 가능성을 예측하고 SFT+RL 결합 처방 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments
- 1.의료 에이전트 벤치마크 MedAgentBench v1/v2에서 41.7% '무행동 상한' 결함 발견
- 2.무행동이 RL 지배 전략이 되는 문제를 고쳐 508개 과제·상한 8.9%의 MAB-v3 구축
- 3.Qwen3-8B 훈련서 능력 상한(20개 중 10개 과제 기본 성능 0%)과 임상코드 형식지식 장벽 확인
- 4.순수 RL 18.2% vs 규칙기반 SFT 34.1%, 'SFT로 코드 주입 후 RL로 조건 학습' 처방 제시
왜 중요한가?
검증기 기반 RL이 의료 에이전트에 통하려면 기반 능력과 형식 지식이 선행돼야 하며, 없으면 그래디언트 자체가 사라짐을 정량화했다. FHIR 표준 위에서 임상 프로토콜을 실행하는 에이전트의 훈련 설계에 직접적 지침을 준다.
언급 프로젝트
본문 미리보기
arXiv:2607.01470v1 Announce Type: new Abstract: Clinical protocol-execution tasks -- checking a lab value, applying a threshold, placing a correctly structured FHIR order -- are natural candidates for RL from world feedback: once clinical SMEs encode decision logic into a verifier, that verifier grades unlimited rollouts without per-episode annotation. But applying RL requires a sound feedback channel and sufficient base capability. We audit MedAgentBench v1/v2, find a 41.7\% silent-finish ceil
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

