은행업에서는 고객 문의에 응답하는 대화형 에이전트가 연락처 변경, PIN 재설정, 송금까지 처리할 수 있어 일반 고객 서비스와 인가·사기 탐지·정책 준수가 분리되지 않는다. 기존 금융사기 벤치마크는 정적 거래·메시지를 분류하고 일반 에이전트 안전 벤치마크는 프롬프트 인젝션 등을 다루지만, 대화 중 발신자가 신원·인가·신뢰를 조작할 때 정책 기반 뱅킹 에이전트가 안전하게 행동하는지는 검증하지 않는다. 이 연구는 τ²-bench 이중통제 프레임워크 위에 구축된 실행 가능한 벤치마크 'FraudBench'를 제안하며, 698건의 내부 정책 문서 코퍼스와 함께 150개의 적대적 시나리오(공개 세트 107개, 10개 사기 메커니즘과 17개 연쇄 적응 공격 포함)를 제공한다. 안전성은 이력 의존적이어서, 이전의 탐색·승인·실패한 시도가 이후 요청을 안전하지 않게 만들 수 있다. 4개 에이전트에 대한 예비 평가에서 공격 방어 성공률은 49~65%였으며, 자금세탁 매개와 본인계정 사기가 모델 전반의 공통 취약점으로 나타났다.
- •FraudBench: 대화형 뱅킹 에이전트의 신원·인가·신뢰 조작 공격에 대한 안전성을 검증하는 실행형 벤치마크
- •698건 내부 정책 문서 코퍼스, 150개 적대적 시나리오(공개 107개, 10개 사기 유형+17개 연쇄 공격) 제공
- •안전성은 이력 의존적: 이전의 탐색·승인이 이후의 겹보기엔 정상적인 요청을 불안전하게 만둥
- •4개 에이전트 예비 평가에서 공격 방어율 49~65%, 자금세탁 매개·본인계정 사기가 공통 취약점
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud
- 1.FraudBench, 금융사기에 대응하는 정책기반 뱅킹 에이전트의 안전성을 검증하는 실행형 벤치마크로 공개
- 2.τ²-bench 이중통제 프레임워크와 698개 문서 내부 정책 코퍼스를 기반으로 150개 적대적 시나리오 구성
- 3.공개 테스트셋 107개(10개 사기 유형 90개+연쇄 적응공격 17개) 기준, 4개 에이전트의 공격 방어율은 49~65%에 그침
- 4.자금세탁 대리인(money-mule)과 1차 사기 유형에서 에이전트들의 취약점이 공통적으로 드러남
왜 중요한가?
은행 상담과 권한부여·사기탐지가 뒤섞인 실제 콜센터 시나리오를 재현해, 대화형 뱅킹 에이전트가 프롬프트 인젝션을 넘어 '신뢰 조작'에 취약할 수 있음을 정량적으로 보여준 실행형 벤치마크다.
언급 프로젝트
본문 미리보기
arXiv:2608.18136v1 Announce Type: new Abstract: Conversational agents now act for end users through tools while holding access to customer databases and internal policy documents that a caller can reach through dialogue alone. Banking is the clearest case: the same agent that answers a question can also change contact details, reset a PIN, or move money, so ordinary customer service is inseparable from authorization, fraud detection, and policy compliance. Existing financial-fraud benchmarks cl
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
