스페인 몬드라곤대 연구진이 검색증강생성(RAG) 시스템을 자동으로 테스트하는 'RagTester'를 개발했다. RagTester는 검색 문서와 테스트 입력, 기대 출력을 자동 생성한 뒤 테스트를 실행하고 LLM을 심사자로 활용해 결과를 평가하며, 복잡한 문단·근거 없는 질의·문서 커버리지를 중점적으로 겨냥한다. LLM 8종과 임베딩 모델 6종을 조합한 24개 구성으로 총 7만2000건의 테스트를 실행한 결과 2만1633건의 오류를 검출했는데, 이는 기존 베이스라인 테스트 생성기보다 6.6% 더 많은 수치이며 24개 구성 중 20개에서 베이스라인을 앞섰다. 검출된 오류에는 부정확한 검색, 근거 없는 답변, 검색된 맥락의 불완전한 활용, 복잡한 문단 해석 실패 등이 포함돼, 배포 전 RAG 시스템 품질 점검에 실질적 효과가 있음을 보여준다.
- •RAG 시스템을 자동 테스트하는 'RagTester' 개발, 복잡 문단·근거 없는 질의·문서 커버리지 중점 공략
- •LLM 8종·임베딩 모델 6종 조합 24개 구성, 총 7만2000건 테스트 실행
- •2만1633건 오류 검출, 기존 베이스라인 대비 6.6% 더 많은 오류 발견
- •부정확한 검색·근거 없는 답변·맥락 불완전 활용 등 다양한 실패 유형 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models
본문 미리보기
arXiv:2608.00054v1 Announce Type: new Abstract: Retrieval-Augmented Generation (RAG) enables Large Language Models (LLMs) to use external and domain-specific knowledge, but its reliability depends on the interaction between the generative model, embedding model, retrieval mechanism, and prompt construction strategy. We present RagTester, an automated end-to-end testing approach for RAG systems. RagTester generates retrieval documents, test inputs, and expected outputs; executes the tests; and e
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

