ATHENA-R1은 1939년 이후 FDA 승인 전 약물을 아우르는 치료 추론(treatment reasoning) AI 에이전트로, 212개 생의학 도구를 활용하도록 강화학습으로 훈련됐다. 각 단계에서 부족한 정보를 파악하고 관련 도구를 선택·실행해 근거를 통합하며, 인간 주석 없이 훈련하기 위해 멀티에이전트가 도구·과제·추론 궤적을 만들어 지도학습한 뒤 과학적 피드백 강화학습으로 근거 수집·근거 기반 도구 사용·논리적 비중복성을 보상한다. 약물 추론 과제 3,168개와 환자 치료 사례 456건의 5개 벤치마크에서 개방형 약물 추론 94.7%, 치료 추론 82.9% 정확도로 GPT-5를 각각 17.8, 10.7점 앞섰다. 28개 희귀질환 단체 전문가 블라인드 평가에서 모든 기준에서 선호됐고, 5.4백만 환자 EHR로 검증한 이상반응 가설은 보정 오즈비 1.48~1.84를 기록했다. 치료 추론을 반복적 근거 수집이라는 학습 가능한 과정으로 재구성할 수 있음을 보여준다.
- •212개 생의학 도구를 활용해 반복적 근거 수집으로 치료를 추론하는 RL 에이전트 ATHENA-R1
- •인간 주석 없이 훈련하는 2단계 자기학습(멀티에이전트 구성 + 과학적 피드백 RL) 프레임워크
- •개방형 약물 추론 94.7%, 치료 추론 82.9% — GPT-5보다 17.8·10.7점 우위
- •5.4백만 환자 EHR 검증에서 이상반응 가설이 보정 오즈비 1.48~1.84, 음성 대조군은 상승 없음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
An AI agent for treatment reasoning over a biomedical tool universe
- 1.ATHENA-R1, 1939년 이후 FDA 승인 전 약물을 대상으로 치료 추론을 수행하는 AI 에이전트 공개
- 2.212개 биомед 도구 위에서 강화학습으로 훈련, 단계마다 부족 정보 파악·도구 실행·근거 반영
- 3.공개형 약물 추론 94.7%, 치료 추론 82.9% 정확도로 GPT-5 대비 각각 17.8·10.7점 상회
- 4.540만 환자 EHR 검증에서 부작용 가설이 보정 오즈비 1.48~1.84 기록, 음성 대조군은 상승 없음
왜 중요한가?
치료 추론은 결론 전에 어떤 근거를 찾을지 알아야 해 오랫동안 AI에 난제였는데, 이를 반복적 근거 수집이라는 학습 가능한 과정으로 재정의해 강화학습으로 훈련할 수 있음을 실증했다. 희귀질환 전문가 블라인드 평가와 물리 임상 사례 검증까지 통과해 의료 의사결정 지원의 실효성을 보였다.
본문 미리보기
arXiv:2606.28692v1 Announce Type: new Abstract: Treatment reasoning underpins every therapeutic decision, integrating disease context, comorbidities, medications, contraindications, and evolving biomedical knowledge to select an appropriate therapy. It is inherently iterative: candidates are weighed against many constraints, revised as evidence emerges, and grounded in verifiable sources. Here we introduce ATHENA-R1, an AI agent for treatment reasoning across all FDA approved drugs since 1939,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

