FinProBench는 실제 금융 전문가가 만든 결과물에서 도출한 역할 기반 루브릭으로 금융 AI 에이전트를 평가하는 벤치마크다. 기존 루브릭 방식이 과제 프롬프트나 모델 출력에서만 기준을 도출해 실무자 결과물에만 드러나는 암묵적 기준을 놓치는 문제를 지적하며, 결과물 수집·역량 추출·루브릭 합성·검증의 4단계로 구성된 재사용 가능한 파이프라인 RGRC를 제안했다. 57개 직군을 관행이 풍부한 30개 직군과 관행이 희소한 27개 특화 직군으로 분류한 결과, 관행이 풍부한 직군에서는 프롬프트만으로도 RGRC와 근접한 성능(89.2% 대 90.7%)을 냈지만 특화 직군에서는 RGRC가 크게 앞섰다(99.1% 대 78.0%). 8개 금융 하위산업 57개 직군 161종 결과물 유형에 걸친 1,723개 결과물로 구축된 FinProBench는 역할당 루브릭 재사용으로 과제별 구축 노력을 기존 대비 6.7배 절감했다.
- •FinProBench, 실무자 결과물 기반 역할 그라운디드 루브릭(RGRC)으로 금융 AI 에이전트 평가
- •57개 직군을 관행 풍부 30개, 관행 희소(특화) 27개로 분류해 비교
- •관행 풍부 직군은 프롬프트만으로도 RGRC와 근접(89.2% vs 90.7%), 특화 직군은 RGRC가 압도(99.1% vs 78.0%)
- •8개 금융 하위산업 57개 직군 161종 1,723개 결과물로 벤치마크 구축, 구축 노력 6.7배 절감
- •4개 평가 시스템 중 인간 결과물이 평균 최고점(73.7점), 신뢰구간은 서로 중첩
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
본문 미리보기
arXiv:2608.04077v1 Announce Type: new Abstract: Evaluating financial AI agents requires criteria aligned with real professional work. Existing rubric methods typically derive criteria from task prompts or model outputs, overlooking tacit standards visible only in practitioner deliverables. We introduce FinProBench, a benchmark for professional financial tasks, and Role-Grounded Rubric Construction (RGRC), a reusable pipeline that derives rubrics from deliverables produced by practitioners in th
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

