NAVI-Orbital은 저궤도(LEO) 위성에 탑재돼 2026년 4월 16일 비전-언어 모델의 첫 궤도 내 자율 멀티모달 추론을 시연한 시스템이다. 로컬 VLM(Gemma 3)으로 촬영 장면을 분류하고 내용·특징 간 관계를 텍스트로 기술하며, 운영자의 자연어 후속 질의에 응답한다. 기존 명령 시퀀스 대신 평문 영어 프롬프트로 재임무를 부여하고, 그래프 기반 상태기계(LangGraph)가 탐지·대화 에이전트를 조율한다. 지상 벤치마크에서 AID 7,960장 기준 88.16% 정확도를 기록했고, 궤도 내 신규 YAM-9 영상까지 미세조정 없이 GPU 가속으로 온보드 처리했다. 위성급 엣지에서 파운데이션 모델을 구동해 '수집 후 전체 다운링크' 방식을 의미 압축으로 뒤집을 수 있음을 입증했다.
- •NAVI-Orbital: 2026년 4월 16일 LEO 위성에서 VLM의 첫 궤도 내 자율 멀티모달 추론 시연
- •로컬 VLM Gemma 3로 장면 분류·텍스트 기술·자연어 대화 수행, 평문 영어 프롬프트로 재임무 부여
- •LangGraph 기반 상태기계가 탐지·대화 전용 에이전트 조율
- •AID 7,960장 벤치마크 88.16% 정확도, 궤도 내 신규 YAM-9 영상 온보드 GPU 추론 처리
- •위성급 엣지 파운데이션 모델로 대역폭 프로파일을 의미 압축으로 반전 가능성 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
NAVI-Orbital: First In-Orbit Demonstration of a Zero-Shot Vision-Language Model for Autonomous Earth Observation
- 1.NAVI-Orbital: 저궤도 위성에서 VLM이 자율 멀티모달 추론을 수행한 세계 최초 권내 시연
- 2.2026년 4월 16일 로컬 VLM(Gemma 3)으로 장면 분류·설명·대화 응답을 온보드 처리
- 3.평이한 영어 프롬프트로 재임무화, LangGraph 그래프 상태머신이 탐지·대화 에이전트 조율
- 4.7,960장 AID 벤치마크에서 88.16% 정확도, 미세조정 없이 온보드 GPU 추론
왜 중요한가?
지구관측 데이터가 다운링크 대역폭을 추월하는 격차를, 위성 엣지에서 파운데이션 모델로 장면을 의미 압축해 '먼저 수집 후 전송' 방식을 뒤집을 수 있음을 실제 궤도에서 처음 입증했다.
언급 프로젝트
지구 관측 데이터의 폭증과 다운링크 대역폭의 한계는 한국의 위성 데이터 활용에 중요한 문제입니다. 궤도상에서 제로샷 비전-언어 모델을 활용한 자율 처리 기술은 국가 안보 및 재난 관리 등에서 신속하고 실질적인 정보 획득을 가능하게 할 것입니다.
본문 미리보기
arXiv:2606.18271v1 Announce Type: new Abstract: As Earth Observation data generation outpaces downlink bandwidth and human-in-the-loop processing, a widening gap has emerged between onboard collection and actionable ground intelligence. This paper presents NAVI-Orbital, a software system deployed on a Low Earth Orbit (LEO) spacecraft. On April 16, 2026, NAVI-Orbital achieved what is, to the authors' knowledge, the first in-orbit demonstration of a vision-language model performing autonomous mul
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

