확산(diffusion) 언어 모델을 의료 도메인에 적용해 방사선 판독 보고서 작성에서 자기회귀(AR) 모델과 정면 비교한 연구다. MoE 확산 모델 DiffusionGemma-26B를 동일 크기 AR 모델 Gemma-4-26B와 같은 LoRA 레시피로 의료 시각 질의응답 데이터셋에서 벤치마크한 결과, 확산 모델이 전 데이터셋에서 동등하거나 우수했고 디코딩 속도는 3.5~4.4배 빨랐다. 파인튜닝된 모델(활성 파라미터 3.8B)은 프론티어급 비전-언어 모델과도 경쟁력이 있다. 핵심 차별점은 양방향 디노이징에서 나오는 임의 순서 인필(any-order infill)로, 방사선 전문의가 보고서 일부를 고정하면 모델이 그 사이를 채워주는 상호작용형 작성이 가능하다. AR 일색인 의료 파운데이션 모델 분야에서 확산 모델의 실용적 우위를 보인 사례다.
- •MoE 확산 모델 DiffusionGemma-26B와 동일 크기 AR 모델 Gemma-4-26B를 동일 LoRA 레시피로 공정 비교
- •의료 VQA 전 데이터셋에서 확산 모델이 AR과 동등 이상, 디코딩은 3.5~4.4배 고속
- •파인튜닝 모델(활성 3.8B)이 프론티어급 비전-언어 모델과 경쟁력 확보
- •양방향 디노이징 특유의 임의 순서 인필: 의사가 보고서 조각을 고정하면 모델이 사이를 채움 — AR은 부적합한 작업
- •장황함 편향을 보정한 LLM 심판으로 평가해 점수 왜곡 최소화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Discrete Diffusion Language Models for Interactive Radiology Report Drafting
- 1.MoE 확산 언어모델 DiffusionGemma-26B를 의료 VQA에 적응, 동급 AR 모델 Gemma-4-26B와 동률 이상
- 2.동일 LoRA 레시피·장황함에 강건한 LLM 심사 기준, 디코딩은 3.5~4.4배 빠름
- 3.양방향 디노이징의 any-order infill로 방사선의가 고정한 문구 사이를 모델이 채우는 초안 작성 지원
- 4.활성 3.8B 파라미터로 프런티어 비전언어모델과 경쟁력 확보
왜 중요한가?
의료 파운데이션 모델이 거의 전부 자기회귀인 상황에서 확산 모델이 성능·속도에 더해 AR이 취약한 부분 채움 편집까지 제공함을 보였다. 임상의가 보고서 일부를 고정하고 나머지를 생성시키는 워크플로는 실제 판독 현장에 맞는 이점이다.
본문 미리보기
arXiv:2607.01436v1 Announce Type: new Abstract: Diffusion language models, which generate text by denoising a token canvas bidirectionally instead of emitting tokens left to right, have become competitive with autoregressive (AR) generation. Medical foundation models, however, remain almost entirely autoregressive. We adapt a mixture-of-experts diffusion language model, DiffusionGemma-26B, and benchmark it against its same-size AR sibling Gemma-4-26B under an identical LoRA recipe on medical vi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

