방사선 보고서에서의 질병 분류 정확도 향상을 위해 SFT 후 GRPO를 적용하는 2단계 학습 방식을 제안한다. 경량 LLM의 SFT는 정확도를 높이지만 추론 능력을 저하시킬 수 있는데, GRPO는 추론 감독 없이 정확도와 형식만 최적화해 이를 보완한다. 방사선 전문의가 라벨링한 3개 데이터셋에서 SFT는 베이스라인을 능가했고, GRPO는 분류 성능과 함께 추론의 재현율 및 포괄성을 추가로 향상시켰다.
- •SFT가 정확도를 높이지만 추론을 저하시키는 문제를 GRPO로 보완
- •GRPO는 추론 감독 없이 정확도와 형식만 보상으로 최적화
- •방사선의 라벨 3개 데이터셋에서 베이스라인 대비 일관된 향상
- •분류 정확도 외에 추론의 재현율과 포괄성도 함께 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports
본문 미리보기
arXiv:2604.19060v1 Announce Type: new Abstract: Accurate disease classification from radiology reports is essential for many applications. While supervised fine-tuning (SFT) of lightweight LLMs improves accuracy, it can degrade reasoning. We propose a two-stage approach: SFT on disease labels followed by Group Relative Policy Optimization (GRPO) to refine predictions by optimizing accuracy and format without reasoning supervision. Across three radiologist-annotated datasets, SFT outperformed ba
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

