T2D-Bench는 LLM의 제2형 당뇨병 권고가 명시적이고 그래프로 검증 가능한 근거 요건을 충족하는지 시험하는 재현 가능 벤치마크이자 근거 게이트 평가 프레임워크다. LLM은 임상적으로 유창한 권고를 내놓으면서도 가이드라인 제약을 어기거나 생활습관-혈당 주장을 명시적으로 정당화하지 못하는 문제가 있다. T2D-Bench는 생의학 축(UMLS·DrugBank·SIDER), 계산 가능한 ADA 진료표준 규칙, 기전 다리로 혈당 검사 효과와 연결된 생활습관 지식을 결합한 다층 임상-생활습관 지식그래프 위에 구축됐다. 진단·약물 안전·적대적 생활습관 충돌을 아우르는 100개 구조화 시나리오에서 GPT-4o-mini는 35%, GPT-4o는 33%가 근거 경로 검사에 실패했다. 근거 게이트는 근거 없는 누락을 탐지하고 제약된 수정으로 검증기 수준 준수를 달성하게 한다.
- •UMLS·DrugBank·SIDER·ADA 규칙·생활습관을 결합한 다층 임상-생활습관 지식그래프 기반
- •100개 구조화 시나리오(진단·약물 안전·생활습관 충돌)로 그래프 검증 가능 근거 요건 평가
- •GPT-4o-mini 35%, GPT-4o 33%가 근거 경로 검사에 실패
- •근거 게이트가 근거 없는 누락을 탐지하고 제약된 수정으로 준수 달성
- •계산 가능한 근거 제약이 임상 누락을 명시·측정·교정 가능하게 만듦
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph
- 1.T2D-Bench: 제2형 당뇨 LLM 출력이 명시적 근거 요건을 충족하는지 검증하는 증거 게이트 프레임워크
- 2.UMLS·DrugBank·SIDER, ADA 진료표준 규칙, 생활습관 지식을 결합한 다층 임상-생활습관 지식그래프 기반
- 3.100개 구조화 시나리오에서 GPT-4o-mini는 35%, GPT-4o는 33%가 근거 경로 검사 실패
- 4.증거 게이트가 근거 없는 누락을 탐지하고 제약 기반 수정으로 검증 수준 준수 달성
왜 중요한가?
LLM이 당뇨 권고를 임상적으로 유창하게 생성해도 가이드라인 근거를 충족하지 못하는 문제를, 계산 가능한 증거 제약으로 근거 없는 누락을 명시·측정·교정 가능하게 만들어 의료 LLM의 신뢰성 검증 틀을 제공한다.
거대 언어 모델(LLM)이 제2형 당뇨병 관련 권고 사항을 제시할 때 임상 지침 준수 여부를 평가하는 T2D-Bench는 의료 AI의 신뢰성을 높이는 데 매우 중요합니다. 이는 고령화 사회의 국내 의료 환경에서 LLM 기반 헬스케어 서비스 도입 시 안전성과 정확성을 확보하고, 관련 규제 준수를 위한 핵심적인 평가 도구로 활용될 수 있습니다. 국내 의료 AI 발전에 필수적인 기준점을 제시합니다.
본문 미리보기
arXiv:2606.24145v1 Announce Type: new Abstract: Large language models (LLMs) can produce clinically fluent recommendations for type 2 diabetes while failing to satisfy guideline constraints or explicitly justify lifestyle-related glycemic claims. We present T2D-Bench, a reproducible benchmark and evidence-gated evaluation framework for testing whether LLM outputs satisfy explicit, graph-checkable evidence requirements. T2D-Bench is built on a multi-layer clinical-lifestyle knowledge graph that
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:55AI 초안

