구글이 로봇의 고수준 플래너 역할을 하는 임바디드 추론 모델 '제미나이 로보틱스 ER 2'를 제미나이 API와 구글 AI 스튜디오를 거쳐 공개하고, 제미나이 엔터프라이즈 에이전트 플랫폼에는 비공개 프리뷰로 제공한다. ER 2는 영상·이미지·오디오·텍스트를 입력받아 장면을 추론하고 몇 분 단위의 작업을 계획한 뒤, 실제 구동은 별도의 VLA(비전-언어-행동) 모델이나 내비게이션 API, 개발자가 정의한 함수에 넘기며 작업 중 구글 검색도 호출할 수 있다. 전작 ER 1.6과 달리 정지 프레임이 아닌 연속 영상을 추론해 작업이 몇 % 완료됐는지 분류하는 '진행률 분류'(정확도 57.4%)와 핵심 이벤트의 정확한 순간을 짚어내는 '모멘트 파인딩'(정확도 91.3%, 평균 오차 0.96초)이라는 두 가지 신기능을 갖췄다. 또한 서로 다른 로봇이 작업을 분담하는 '다중 로봇 협업'을 도입해 Apptronik의 인간형 로봇 아폴로 2와 Franka 듀오 양팔 플랫폼이 협력하는 시연, 보스턴 다이내믹스 스팟이 음성 명령으로 물건을 가져오는 시연을 공개했다. 구글은 의료·운송 등 안전이 치명적인 분야에는 이 모델을 쓰지 말라고 명시하며, 검사·창고 처리·실험실 작업 등에 우선 배치될 것으로 보인다.
- •제미나이 뇜보틱스 ER 2, 뇜보의 국수중 플놤놤뇜로 제미놤이 API·AI 스튀놱오에서 거제거워름광거뇝낙
- •연속 영상 추놤으로 작업 놤캩율 분뇠(전황놤 57.4%)와 핵심 순간 포촀(믵촜낙 91.3%, 오려 0.96초) 신기놥 큰쿩
- •Apptronik 아펼뇜 2샯 Franka 놤어의 놤중 뇜보 혜업, 볼스톤 뇤뇜뇝스 스폜 썌성 놲낙 시연륬 공개
- •사른뇝이 거까이 오륬 인간놤 뇜보낖 놤켤 자율적뇝로 장거하낖 안전 기놥 강화
- •구금에낖 의놡·운송 놱 안전할 지놩나 부잤에낖 사장기뇝낙, 검잤·켄고 처리·실햷스에 우선 뱰용 전릥
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Google Ships Gemini Robotics ER 2 With Multi-Robot Teamwork

본문 미리보기
Google has launched Gemini Robotics ER 2, an embodied-reasoning model built to serve as a robot's high-level planner while a separate model handles the motors. It is available to developers through the Gemini API and Google AI Studio, with private-preview access on the Gemini Enterprise Agent Platform. ER 2 takes in video, images, audio and text, reasons about the scene, plans a task that runs several minutes, then calls something else to move the hardware: a vision-language-action model, a…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:51AI 초안

