GuideSkill은 임상 진료 가이드라인(CPG)의 진단 기준을 서수형 진단 지지 점수를 반환하는 실행 가능한 함수로 컴파일하는 외부 추론 계층으로, 가이드라인에서 초기화되는 GuideSkill-Zero와 사례-진단 쌍으로 스킬을 정교화하고 누락된 진단을 추가하는 GuideSkill-Evo로 구성된다. 추론 시 LLM이 감별 진단을 제시하면 각 매칭된 스킬이 요구하는 특징을 근거로 삼아 순위를 실행된 스킬 점수와 결합한다. 네 개 벤치마크와 네 개 기반 모델에서 GuideSkill-Zero는 가이드라인 기반 RAG보다 평균 매크로 정확도를 13.45% 높였고, GuideSkill-Evo는 모든 기반 모델에서 최고 매크로 평균을 달성해 직접 추론 대비 18.49% 상대적 개선을 이루었으며 정답 스킬 커버리지를 56.5%에서 99.5%로 끌어올렸다. Qwen3.5-9B에서는 백본을 업데이트하지 않고도 가장 강력한 파라미터 업데이트 기준선을 11.16% 앞섰다.
- •임상 진료 가이드라인을 실행 가능한 진단 지지 점수 함수로 컴파일하는 외부 추론 계층
- •GuideSkill-Zero는 가이드라인 RAG보다 매크로 정확도 평균 13.45% 향상
- •GuideSkill-Evo는 직접 추론 대비 18.49% 상대 개선, 정답 스킬 커버리지 56.5%→99.5%
- •Qwen3.5-9B에서 백본 업데이트 없이 최강 파라미터 업데이트 기준선을 11.16% 앞서
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning
본문 미리보기
arXiv:2607.26160v1 Announce Type: new Abstract: Clinical practice guidelines (CPGs) encode diagnostic criteria, but LLM systems typically retrieve guideline text or absorb it through training rather than execute its rules. We introduce GuideSkill, an external reasoning layer that compiles disease-specific criteria into executable functions returning ordinal diagnostic-support scores. GuideSkill-Zero is initialized from guidelines, while GuideSkill-Evo uses case--diagnosis pairs to refine covere
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:49AI 초안

