페이페이 리 교수가 공동 설립한 월드랩스가 멀티모달 월드 모델 '아틀라스'를 공개했다. 아틀라스는 단 하나의 이미지만으로도 대규모 3D 장면을 재구성하고, 픽셀 단위로 카메라 위치·방향을 직접 제어해 원하는 시점에서 영상을 생성하는 '픽셀 퍼펙트 카메라 컨트롤' 기능을 지원한다. 텍스트, 2D 이미지, 카메라 포즈, 3D 깊이 정보를 하나의 모델에서 처리하는 멀티모달 오토리그레시브 확산 트랜스포머 구조를 기반으로 하며, 실제 환경을 가상 세계로 재구성해 로봇을 학습시키는 '리얼 투 심 투 리얼' 연구에 핵심적으로 활용될 전망이다. 구글·메타·엔비디아 등도 월드 모델 경쟁에 뛰어들고 있는 가운데, AI의 출력 단위가 콘텐츠에서 '세계' 자체로 확장되고 있음을 보여주는 사례로 평가된다.
- •하나의 이미지만으로 대규모 3D 장면 재구성 및 새 카메라 시점 영상 생성 가능
- •'픽셀 퍼펙트 카메라 컨트롤'로 카메라 위치·방향을 공간 정보로 직접 제어
- •멀티모달 오토리그레시브 확산 트랜스포머 구조로 텍스트·이미지·카메라 포즈·3D 깊이 통합 처리
- •실제 공간을 가상 세계로 재구성해 로봇을 학습시키는 R2S2R 연구에 활용 기대
- •현재 일부 파트너 대상 얼리 액세스 제공, 구글·메타·엔비디아와 월드 모델 경쟁 본격화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
[AI 이슈] 페이페이 리 교수의 '월드랩스', 세계 최초 멀티모달 월드 모델 ‘아틀라스’ 공개
본문 미리보기
스탠퍼드대학교 인간중심인공지능연구소(Stanford Institute for Human-Centered AI, HAI)의 공동 창립자이자 인공지능(AI) 분야의 대표적인 컴퓨터 비전 연구자인 페이페이 리(Fei-Fei Li) 교수가 공동 설립한 월드랩스(World Labs)가 차세대 멀티모달 월드 모델 ‘아틀라스(Atlas)’를 공개했다.월드랩스는 1일(현지시간) 아틀라스를 공개하고, 이를 공간 지능(Spatial Intelligence)을 위한 새로운 ‘옴니(omni) 월드 모델’이라고 소개했다. 아틀라스는 이미지와 영상 생성뿐
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안



