PRISM은 비전-언어 모델(VLM)과 LLM을 동적 질문-답변(DQA) 파이프라인으로 긴밀히 결합한 구현 에이전트 프레임워크입니다. LLM이 VLM의 장면 설명을 비판하고 목표 지향적 질문을 던져 정밀한 태스크 중심 이해를 이끌어내며, 독립형 VLM의 태스크 중요 정보 누락 문제를 해결합니다. ALFWorld와 Room-to-Room 벤치마크에서 최신 이미지 기반 모델을 크게 능가하며 수작업 없이 완전 자동화로 동작합니다.
- •LLM이 VLM 설명을 비판하고 목표 지향 질문을 던지는 동적 폐쇄 루프 상호작용 구현
- •독립형 VLM의 태스크 중요 정보 누락 문제(지각-추론-결정 격차) 해소
- •수작업 질문 없이 완전 자동화된 파이프라인으로 ALFWorld·R2R 벤치마크에서 SOTA 능가
- •인터랙티브 목표 지향 지각 파이프라인이 성능 향상의 핵심 요인임을 체계적으로 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PRISM: Perception Reasoning Interleaved for Sequential Decision Making
- 1.PRISM은 지각(VLM)과 결정(LLM)을 동적 질의응답 파이프라인으로 연결한 체화 에이전트 프레임워크
- 2.LLM이 VLM의 장면 설명을 비판·질문하고 압쳙된 과제 중심 설명을 합성하는 폐루프 상호작용 구현
- 3.ALFWorld 및 Room-to-Room 벤치마크에서 최신 이미지 기반 모델 대비 유의미하게 향상된 성능
왜 중요한가?
VLM의 지각-추론-결정 격차를 폐루프 상호작용으로 해결하여 복잡한 멀티모달 환경에서 LLM 기반 체화 에이전트의 성능을 실질적으로 향상시킨다.
언급 프로젝트
본문 미리보기
arXiv:2605.05407v1 Announce Type: new Abstract: Scaling LLM-based embodied agents from text-only environments to complex multimodal settings remains a major challenge. Recent work identifies a perception-reasoning-decision gap in standalone Vision-Language Models (VLMs), which often overlook task-critical information. In this paper, we introduce PRISM, a framework that tightly couples perception (VLM) and decision (LLM) through a dynamic question-answer (DQA) pipeline. Instead of passively acce
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

