금융 LLM 에이전트의 성과 평가에서 단순 수익률 비교가 '사건 선택 능력'을 실제보다 과대평가할 수 있다는 문제를 지적하고, 이를 분리하는 '에이전트 정책-가치 감사' 기법이 제안됐다. 관측된 행동 전환 유형별 횟수는 고정한 채 적격 사건들에 무작위로 재배정해 '구성 기준선'을 산출하고, 실제 배치 가치와의 차이를 '선택 가치'로 정의한다. 실제 실적 기반 반합성 벤치마크에서 기존 평균-영 비교 방식은 무능력 복제본의 11.6%에서 선택 능력을 허위로 인정한 반면, 전환 매칭 감사는 이를 5.3%로 낮췄다. 미국 소비자 대상 44개 기업의 723개 실적 발표 사건에 소급 적용한 결과, 총 배치 가치 +15.2bp는 구성 기준선 +25.8bp와 선택 가치 -10.6bp로 분해돼 해당 에이전트가 무작위 배정 대비 우위를 보이지 못한 것으로 나타났다.
- •단순 수익률 비교와 분리해 '사건 선택 능력'만 측정하는 에이전트 정책-가치 감사 기법 제안
- •행동 전환 유형별 횟수를 고정한 무작위 재배정으로 '구성 기준선' 산출
- •기존 평균-영 검정은 무능력 복제본의 11.6%를 허위로 능력 인정, 새 감사는 5.3%로 감소
- •723개 실적 사건 소급 적용 결과 해당 에이전트는 선택 가치 -10.6bp로 무작위 대비 우위 없음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Agent Policy-Value Audit: Separating Transition Composition from Event Selection in Financial LLM Agents
- 1.금융 LLM 에이전트 평가서 포지션 변경 빈도가 상승장에서 '가짜 성과'를 만드는 문제를 분리하는 감사 기법 제안
- 2.관측된 행동 전환 빈도를 고정한 채 이벤트에 무작위 재배정한 '구성 벤치마크' 대비 실제 선택 가치 산출
- 3.반합성 벤치마크서 기존 방식은 무작위 운용에 선택 능력 있다고 11.6% 오판, 제안 기법은 5.3%로 감소
- 4.美 기업 44곳 723개 실적 이벤트 분석, 총 배치가치 +15.2bp는 구성효과 +25.8bp와 선택가치 -10.6bp로 분해
왜 중요한가?
금융 AI 에이전트의 수익률이 '운용 노출'에서 온 것인지 '선택 능력'에서 온 것인지를 통계적으로 분리해야 한다는 점을 실데이터로 입증해, 금융 에이전트 성과 평가에 구체적 개선 기준을 제시한다.
본문 미리보기
arXiv:2610.04040v1 Announce Type: new Abstract: Financial LLM agents are often evaluated by comparing their end-to-end returns with those of a baseline and testing the paired difference against zero. This measures whether deploying the agent changes realized performance, but it does not isolate event-selection skill. An agent that frequently changes positions from flat to long can earn a positive paired return from an upward-drifting event pool even when it selects events at random. We propose
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

