iFLYTEK-Embodied-Omni는 시각(영상·이미지), 언어, 행동을 단일 Omni 프레임워크에서 공동 모델링하는 통합 멀티모달 파운데이션 모델이다. 시각-언어 모델과 비디오 생성 모델이 지시 이해·과제 계획·진행 추적·미래 시각 상태 예측을 담당하는 '뇌' 역할을, 행동 생성 모델이 하위 목표를 실행 가능한 행동 청크로 변환하는 '소뇌' 역할을 맡는 뇌-소뇌 협업 구조로, 모달리티별 구성 요소가 공유 멀티모달 셀프어텐션으로 소통한다. 관측을 먼저 생성하고 행동을 추론하는 기존 캐스케이드 방식의 인터페이스 병목과 오류 누적 문제를 겨냥했다. 행동 주석 유무를 아우르는 체화 비디오와 추론·지각·이미지-텍스트 데이터로 학습했으며, VLM·VGM·AGM을 단계적으로 훈련한 뒤 전체를 공동 미세조정하는 4단계 전략을 썼다.
- •시각·언어·행동을 단일 프레임워크에서 공동 모델링하는 통합 멀티모달 파운데이션 모델
- •VLM+비디오 생성 모델이 고수준 '뇌', 행동 생성 모델이 저수준 '소뇌' 역할을 하는 협업 구조
- •공유 멀티모달 셀프어텐션으로 캐스케이드 파이프라인의 병목과 예측 오류 누적 문제 해소
- •사람 시연·로봇 상호작용 비디오와 범용 이미지-텍스트 데이터를 결합한 대규모 데이터셋 구축
- •VLM→VGM→AGM 순차 훈련 후 전체 공동 미세조정하는 4단계 학습 전략
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
iFLYTEK-Embodied-Omni Technical Report
- 1.iFLYTEK-Embodied-Omni 공개: 비전·언어·행동을 단일 Omni 프레임워크로 통합한 임바디드 파운데이션 모델
- 2.VLM+비디오생성 모델이 고수준 '뇌', 행동생성 모델이 저수준 '소뇌' 역할을 맡는 협력 구조
- 3.카스케이드 파이프라인의 인터페이스 병목·오류 누적 문제를 공유 멀티모달 self-attention으로 해소
- 4.인간 시연·로봇 데이터를 결합한 데이터셋과 VLM→VGM→AGM 4단계 점진 훈련 전략 채택
왜 중요한가?
시각-언어 추론, 월드모델링, 행동 생성을 각각 전문화하던 기존 접근과 달리 세 능력을 한 모델에서 공동 학습시켜 캐스케이드 방식의 오류 누적을 구조적으로 피했다. 중국 iFLYTEK의 참전으로 로봇 파운데이션 모델 경쟁이 한층 가열되는 신호이기도 하다.
언급 프로젝트
본문 미리보기
arXiv:2607.02542v1 Announce Type: new Abstract: General-purpose embodied agents must understand multimodal instructions, anticipate how their environment will evolve, and produce precise control actions over extended horizons. Existing approaches typically specialize in visual-language reasoning, video-based world modeling, or action generation, while cascaded pipelines that first synthesize future observations and then infer actions can introduce interface bottlenecks and compound prediction e
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

