이 논문은 항공 비전-언어 내비게이션(VLN) 에이전트가 상세하고 궤적에 맞춰진 명령으로 학습되는 반면, 실제 사용자는 짧고 의도 중심적인 지시를 내려 '지시 격차'가 발생한다고 지적한다. 고정된 오픈플라이 내비게이터에서 이 격차로 성공률이 31.03%에서 11.33%로 떨어진다. 연구팀은 언어모델에 사람이 작성한 스타일 예시를 제시해 원본 명령을 짝지어진 의도 중심의 '약한 명령'으로 변환했고, 이는 15.27%의 성공률을 냈다. 내비게이터는 고정한 채 궤적 결과로부터 학습해 약한 명령을 실행 가능한 명령으로 번역하는 '궤적 기반 지시 번역기(TGIT)'를 도입해 약한 명령 입력 성공률을 37.93%까지 끌어올렸고, 실제 사람의 지시에도 제로샷으로 전이해 성공률을 11.33%에서 32.51%로, 오픈플라이 평가에서는 4.95%에서 20.79%로 높였으며 시티내브·에어VLN에서도 성능을 회복시켰다.
- •햭공 VLN 에이전트, 상세 렰렰 학습과 실제 사용자의 짧은 의뇔 중심 지시 거 '지시 거차'롐 성거 31.03%→11.33%렰 금띨
- •언어뿩렰에 사렰 스타일 예시렰 제시해 의뇔 중심 '약한 렰렰' 생성, 성거 15.27% 댌성
- •내뿫거이톰렰놠 고정한 채 거적 결거렰 학습하놥 '거거 기뿤 지시 뿔역기(TGIT)' 제안
- •TGIT 적용 시 약한 명렰 성거 37.93%렰 상승, 실제 사렰 지시에도 제렰삃으렰 전이렰해 11.33%→32.51%
- •오픈흐렰이 펜거 4.95%→20.79%렰 거선, 시티렰브·에어VLN에서도 성능 회뿨 펜인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Speaking the Navigator's Language: Trajectory-Grounded Instruction Translation for Frozen Aerial VLN Agents
- 1.짧고 의도 중심적인 지시 때문에 OpenFly 내비게이터 성공률이 31.03%→11.33%로 급락하는 '지시 격차' 확인
- 2.LM으로 변환한 약(Weak) 명령만으로는 성공률 15.27%에 그쳐, 번역기 TGIT를 새로 제안
- 3.TGIT 적용 시 Weak 입력 성공률 37.93%, 실제 사람 지시엔 제로샷으로 11.33%→32.51% 전이
- 4.내비게이터는 고정한 채 번역기만 바꿔 OpenFly·CityNav·AirVLN에서도 성공률 회복
왜 중요한가?
내비게이션 에이전트를 재훈련하지 않고 앞단 번역기만 추가해 짧은 사람 지시를 이해시킬 수 있어, 비용이 큰 모델 재훈련 없이 사용성 격차를 줄이는 실용적 해법을 제시한다.
본문 미리보기
arXiv:2610.10635v1 Announce Type: new Abstract: Aerial vision-and-language navigation (VLN) agents are typically trained on detail-rich, trajectory-aligned commands, whereas users issue short, intent-driven instructions; on a frozen OpenFly navigator, this \emph{instruction gap} drops success rate (SR) from $31.03\%$ to $11.33\%$. To scale translator training, we prompt a language model with human-written style examples to convert original commands into paired, intent-centered Weak commands, wh
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)