엔비디아가 로보택시·자율주행차 개발용 차세대 비전-언어-행동(VLA) 모델 '알파마요 2 슈퍼'를 공개했다. 340억 파라미터 규모로 코스모스 3 슈퍼 리즈너 기반 320억 파라미터 VLM과 23억 파라미터 확산 기반 행동 디코더를 결합했으며, 강화학습 사후학습을 거쳐 다중 카메라 영상과 텍스트, 이동 이력을 입력받아 6.4초 주행 궤적, 인과 추론(CoC) 설명, 메타 액션, 자동 라벨, 시각 질의응답 등 5가지 결과를 한 번의 추론으로 동시에 생성한다. 약 11만5000시간의 다중 카메라 영상과 10억 장 이상의 이미지, 370만 건의 CoC 추론 데이터로 학습됐으며, 자율주행 추론 벤치마크 링고QA에서 79.2점으로 평가 대상 약 40개 모델 중 1위를 차지해 GPT-4o보다 23.2점 높았다. 가중치는 리눅스 재단 오픈MDW-1.1 라이선스로, 소스코드는 아파치 2.0으로 공개돼 상업적 활용이 가능하다.
- •320억 파라미터 VLM과 23억 파라미터 확산 기반 행동 디코더를 결합한 340억 파라미터 VLA 모델이다.
- •한 번의 추론으로 주행 굤적, 인과 추론 설명, 메타 액션, 자동 라벨, 시각 질의응답 5가지를 동시 생성한다.
- •약 11만5000시간의 주행 영상과 370만 건의 CoC 추론 데이터로 학습되었다.
- •링고QA 벤치마크에서 79.2점으로 약 40개 모델 중 1위, GPT-4o보다 23.2점 높았다.
- •가중치는 오픈MDW-1.1, 소스코드는 아파치 2.0 라이선스로 공개되어 상업적 재배포가 가능하다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
엔비디아,자율주행용 VLA 모델 '알파마요 2 슈퍼' 공개...로보택시 상용화 겨냥
본문 미리보기
엔비디아가 희귀하고 복잡한 도로 상황까지 스스로 이해하고 판단 과정을 설명할 수 있는 차세대 개방형 자율주행 AI 모델을 공개하며 로보택시와 자율주행 생태계 공략에 나섰다. 엔비디아는 4일(현지시간) 로보택시와 자율주행차 개발을 위한 차세대 비전-언어-행동( VLA) 모델 '알파마요 2 슈퍼(Alpamayo 2 Super)'를 공개했다.340억(34B) 매개변수 규모의 이 모델은 자율주행 AI의 가장 큰 난제로 꼽히는 '롱테일(long-tail)' 상황을 해결하는 데 초점을 맞췄다.엔비디아의 '코스모스 3 슈퍼 리즈너(Super R
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안
