FinRAG-12B는 은행 산업의 고정밀도·규제 준수 요구에 맞춘 도메인 특화 LLM 훈련 프레임워크로, 1억 4,300만 토큰만으로 근거 기반 응답 품질, 인용 주석, 보정된 거절 메커니즘을 동시에 최적화합니다. 40개 이상의 금융 기관에 배포되어 쿼리 해결률 7.1%p 향상을 달성했으며, GPT-4.1 대비 응답 속도 3~5배 빠르고 비용은 20~50배 저렴합니다. 인용 근거에서는 GPT-4.1을 능가하면서도 '모르겠습니다' 응답률 12%로 안전한 거절 행동을 구현했습니다.
- •1억 4,300만 토큰으로 LLM-as-a-Judge 필터링·인용 주석·커리큘럼 학습 결합한 효율적 훈련
- •22% 답변 불가 예시 훈련으로 안전한 거절 응답률 12% 달성, 베이스 모델 4.3% 대비 개선
- •40개 이상 금융 기관 배포, GPT-4.1 대비 3~5배 빠른 응답 및 20~50배 낮은 비용
- •인용 근거에서 GPT-4.1 능가, 쿼리 해결률 7.1%p 향상(p<0.001)
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking
- 1.FinRAG-12B는 143M 토큰만으로 훈련된 은행 도메인 특화 12B LLM으로 인용 근거에서 GPT-4.1 능가
- 2.40개 이상 금융기관 배포 시 쿼리 해결률 7.1%p 향상, GPT-4.1 대비 3~5배 빠른 응답 속도 달성
- 3.과잉 거부 없이 12% 모름 응답률로 안전한 캘리브레이션 실현, 비용은 GPT-4.1의 2~5%
왜 중요한가?
규제 준수와 검증 가능한 응답이 요구되는 금융 산업에서 GPT-4.1을 능가하는 비용 효율적 도메인 특화 LLM의 실제 대규모 배포 사례를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2605.05482v1 Announce Type: new Abstract: Large language models (LLMs) are rapidly being adopted across various domains. However, their adoption in banking industry faces resistance due to demands for high accuracy, regulatory compliance, and the need for verifiable and grounded responses. We present a unified, data-efficient framework for training grounded domain-specific LLMs that optimizes answer quality, citation grounding, and calibrated refusal under real-world deployment constraint
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

