자연어는 로봇에게 유연한 작업 인터페이스를 제공하지만, 구체화된(embodied) 환경에서의 목표 모호성은 사용자 의도 문제뿐 아니라 현재 관측에 작업 관련 물리적 증거가 없어서도 발생한다. 기존 상호작용적 모호성 해소 방법은 주로 사용자에게 되물어 정보를 얻지만, 가림·제한된 시야각·읽을 수 없는 텍스트·미관측 대상 같은 상황에서는 로봇이 관측 자체를 능동적으로 바꿔야 한다. 이 논문은 능동 관측을 정보 획득의 중심으로 삼고, 시각-언어 모델이 누적된 시각 증거와 상호작용 정보를 바탕으로 계속 관측할지, 명확화를 요청할지, 목표 선택을 완료할지 판단하는 능동 지각 프레임워크를 제안한다. 능동 관측은 누락된 판별 증거를 직접 복구하는 동시에 사물 이름·라벨·의미적 속성을 드러내 필요시 사용자 명확화의 질도 높인다. 실제 로봇 실험에서 이 프레임워크가 물리적 정보 획득과 사용자 의도 명확화를 하나의 통합된 구체화 모호성 해소 과정으로 결합함을 보였다.
- •목표 모호성이 사용자 의도뿐만 아니라 관측 내 물리적 증거 부재에서도 발생함을 지적.
- •시각-언어 모델이 계속 관측·명확화 요청·목표 선택 완료 중 하나를 결정하는 능동 지각 프레임워크 제안.
- •능동 관측이 판별 증거 복구와 사물 이름·라벨 등 의미 정보 노출을 동시에 가능하게 함.
- •실제 로봇 실험으로 물리적 정보 획득과 사용자 의도 명확화의 통합을 검증.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Active Perception for Embodied Disambiguation
- 1.로봇의 능동적 지각 능력
- 2.모호한 목표 해결에 기여
- 3.실제 환경 내 증거 부족 문제
왜 중요한가?
로봇이 자연어 지시를 따를 때 발생하는 목표 모호성을 해결하기 위해 능동적 지각 능력이 필수적임을 강조하며, 이는 로봇이 실제 환경에서 더욱 효과적으로 임무를 수행하도록 돕는 중요한 발전 방향입니다.
한국은 로봇 산업 육성에 적극적이며, 로봇이 실제 환경에서 인간의 복잡한 지시를 이해하고 수행하는 것은 핵심 과제입니다. 이 연구에서 제안하는 능동적 지각 개념은 국내 서비스 로봇이나 산업용 로봇 개발자들이 모호한 상황에서 로봇의 자율성을 높이고 사용자 경험을 개선하는 데 중요한 기술적 기반을 제공할 것입니다. 이는 로봇 상용화에 필수적인 단계입니다.
본문 미리보기
arXiv:2608.13605v1 Announce Type: new Abstract: Natural language provides robots with a flexible task interface, but target ambiguity in embodied environments arises not only from user intent; it can also result from missing taskrelevant physical evidence in the current observation. Existing interactive disambiguation methods primarily obtain additional information by asking the user, whereas occlusion, restricted viewpoints, unreadable text, and unobserved targets require the robot to actively
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

