복잡한 실세계 태스크를 해결하는 범용 구현 에이전트의 견고성 향상을 위해 추론 시 여러 후보 행동을 샘플링하고 생성형 검증자로 최적 행동을 선택하는 VeGAS 프레임워크를 제안합니다. 기존 MLLM을 검증자로 직접 사용하면 효과가 없어, LLM 기반 데이터 합성으로 다양한 실패 사례 커리큘럼을 자동 구성했습니다. Habitat 및 ALFRED 환경에서 강한 CoT 기준 모델 대비 최대 36% 상대적 성능 향상을 달성했습니다.
- •VeGAS는 구현 에이전트의 행동 선택을 개선하는 테스트 타임 검증 프레임워크
- •단순 MLLM 검증자의 한계를 LLM 기반 실패 사례 합성 데이터로 극복
- •기존 정책 수정 없이 후보 행동 앙상블에서 최적 행동 선택
- •Habitat·ALFRED 환경에서 CoT 기준 대비 최대 36% 상대 성능 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
- 1.MLLM 기반 구현형 에이전트의 분포 외 취약성을 보완하는 VeGAS 테스트 타임 프레임워크 제안
- 2.후보 행동 앙상블 샘플링 후 생성적 검증기가 가장 신뢰할 수 있는 행동 선택
- 3.LLM 기반 데이터 합성으로 다양한 실패 사례 커리큘럼을 자동 구성해 검증기 훈련
- 4.Habitat·ALFRED 환경에서 CoT 기준선 대비 최고 36% 상대 성능 향상 달성
왜 중요한가?
기존 정책 변경 없이 검증 단계만 추가해 구현형 에이전트의 강건성을 크게 향상시키는 실용적 프레임워크로, 실세계 로봇 및 에이전트 배포에 즉시 적용 가능하다.
언급 프로젝트
본문 미리보기
arXiv:2605.12620v1 Announce Type: new Abstract: Building generalist embodied agents capable of solving complex real-world tasks remains a fundamental challenge in AI. Multimodal Large Language Models (MLLMs) have significantly advanced the reasoning capabilities of such agents through strong vision-language knowledge and chain-of-thought (CoT) reasoning, yet remain brittle when faced with challenging out-of-distribution scenarios. To address this, we propose Verifier-Guided Action Selection (Ve
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

