비전-언어모델(VLM)은 유창하지만 시각적으로 충실하지 않은 환각을 자주 일으키며, 기존 체인오브소트·검색증강 방법은 단계별 인용 근거를 강제하지도, 검증 실패를 검색으로 되돌려 교정하지도 못한다. CaVe-VLM-CoT는 추출기·검색기·해결기·인용 주입기·검증기의 5단계 폐루프로 증거 기반 추론을 강제하는 모듈식 반성 기반 에이전트 RAG 프레임워크로, 근거 없는 주장이 감지되면 구조화된 피드백이 추출기로 전달돼 표적 재검색을 유발한다. 검색 품질·단계별 인용 충실도·교차모달 근거를 함께 측정하는 틀이 없었기에, 전 단계에 걸친 23개 구성요소별 지표와 정확도·인용 정밀도/재현율·귀속·증거 근거를 가중한 복합 지표 CaVeScore를 제안한다. 아키텍처나 프롬프트 수정 없이 ScienceQA에서 정확도 87.1%·CaVeScore 56.6%, MMMU(30개 과목)에서 55.2%·35.7%를 달성했다.
- •추출기·검색기·해결기·인용 주입기·검증기 5단계 폐루프로 증거 기반 추론 강제
- •근거 없는 주장 감지 시 구조화 피드백으로 추출기에 표적 재검색 유발
- •23개 구성요소별 지표와 복합 지표 CaVeScore 제안
- •ScienceQA 87.1% 정확도·56.6% CaVeScore, MMMU 55.2%·35.7% 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework
- 1.CaVe-VLM-CoT: VLM 환각을 줄이는 반성 기반 에이전틱 RAG 프레임워크
- 2.추출·검색·해결·인용 주입·검증 5단계 폐루프로 근거 기반 추론 강제
- 3.근거 없는 주장이 탐지되면 추출기로 피드백해 표적 재검색 수행
- 4.ScienceQA 정확도 87.1%·CaVeScore 56.6%, MMMU 55.2%·CaVeScore 35.7% 달성
왜 중요한가?
단계별 인용 그라운딩을 강제하지 못하고 검증 실패를 재검색으로 되돌리지 못하던 기존 CoT·RAG 한계를, 폐루프 구조와 23개 세부 지표로 보완해 시각적으로 충실한 VLM 추론을 가능하게 한다.
언급 프로젝트
AI 윤리 및 신뢰성 확보에 대한 사회적 요구가 높은 한국에서, 환각 현상을 줄이고 설명 가능한 비전-언어 모델(VLM) 프레임워크는 필수적입니다. 이 기술은 의료, 법률, 금융 등 민감한 분야에서 AI 모델의 신뢰도를 높여 국내 AI 산업의 책임감 있는 성장에 크게 기여할 것입니다.
본문 미리보기
arXiv:2606.18385v1 Announce Type: new Abstract: Vision-Language Models (VLMs) remain prone to hallucinations, producing fluent but visually unfaithful outputs. Existing chain-of-thought and retrieval-augmented methods only partially address this, as they neither enforce step-level citation grounding nor route verification failures back to retrieval for correction. We present CaVe-VLM-CoT, a modular reflection-based agentic-RAG framework that enforces evidence-grounded reasoning through a five-s
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

