비전-언어 모델(VLM)의 안전 중요 애플리케이션에서 해석 가능한 실패 모드를 체계적으로 발굴하는 REVELIO 프레임워크를 소개합니다. 다양성 인식 빔 탐색과 가우시안 프로세스 톰슨 샘플링으로 지수적으로 큰 조합 공간을 효율적으로 탐색합니다. 자율주행과 실내 로봇 도메인에서 공간 인식 취약성, 장애물 미고려로 인한 충돌 위험, 안전 위험 감지 실패 등 이전에 보고되지 않은 취약점을 발견하여 VLM 안전성 개선을 위한 실행 가능한 통찰을 제공합니다.
- •REVELIO는 VLM의 실패 모드를 해석 가능한 개념 조합으로 체계적으로 발굴하는 프레임워크
- •다양성 인식 빔 탐색과 가우시안 프로세스 탐색으로 광대한 조합 공간을 효율적으로 커버
- •자율주행에서 공간 인식 약점 및 장애물 미고려로 인한 충돌 위험 취약점 발견
- •실내 로봇 태스크에서 안전 위험 감지 실패와 과보수적 오탐 문제 식별
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Revealing Interpretable Failure Modes of VLMs
- 1.VLM의 해석 가능한 실패 모드를 체계적으로 발굴하는 REVELIO 프레임워크 제안
- 2.다양성 인식 빔 탐색과 가우시안 프로세스 톰슨 샘플링으로 광대한 실패 공간 탐색
- 3.자율주행 도메인에서 공간 인식 미흡·장애물 미고려로 시뮬레이션 충돌 유발 취약점 발견
- 4.실내 로봇공학에서 안전 위험 누락 또는 과도한 보수성으로 오경보 발생 패턴 식별
왜 중요한가?
안전이 중요한 응용에 배포되는 VLM의 구체적이고 해석 가능한 취약점을 사전 식별함으로써, 표적화된 안전성 개선을 가능하게 하는 실용적 진단 도구를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2605.12674v1 Announce Type: new Abstract: Vision-Language Models (VLMs) are increasingly used in safety-critical applications because of their broad reasoning capabilities and ability to generalize with minimal task-specific engineering. Despite these advantages, they can exhibit catastrophic failures in specific real-world situations, constituting failure modes. We introduce REVELIO, a framework for systematically uncovering interpretable failure modes in VLMs. We define a failure mode
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

