엔비디아가 64B 월드 파운데이션 모델 '코스모스3 슈퍼'를 증류한 '코스모스3-슈퍼-텍스트2이미지-4스텝'과 '이미지2비디오-4스텝'을 허깅페이스에 공개했다. 텍스트-이미지 추론 단계를 50단계에서 4단계로, 이미지-비디오는 35단계에서 4단계로 약 90% 줄이고 분류기 없는 가이드(CFG)까지 제거해 효율을 높였다. 아티피셜 애널리시스 리더보드에서 이미지2비디오-4스텝은 오픈웨이트 1위(전체 16위)로 기존 35단계 버전을 앞섰고, 텍스트2이미지-4스텝도 오픈웨이트 3위에 올랐다. 최대 720p·8초 영상을 생성하며 로봇·자율주행용 합성 데이터 구축을 겨냥한 피지컬 AI 모델로, 상업적 활용도 허용된다.
- •추론 단계 약 90% 축소: 텍스트-이미지 50→4단계, 이미지-비디오 35→4단계, CFG 제거
- •아티피셜 애널리시스 리더보드서 이미지-비디오 오픈웨이트 1위·전체 16위, 기존 35단계 버전보다 높은 순위
- •64B 코스모스3 슈퍼 기반 증류 모델로 허깅페이스 공개, 상업적 활용 허용
- •최대 720p, 이미지 1장으로 약 8초(189프레임) 영상 생성…로봇·자율주행 합성 데이터용 피지컬 AI 지향
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
엔비디아, '코스모스3 4스텝' 증류 모델 출시..."추론 90% 줄여도 오픈웨이트 최고 성능"
본문 미리보기
엔비디아가 추론 속도를 대폭 높인 오픈웨이트 AI 모델 '코스모스3 슈퍼 4스텝(Cosmos3-Super 4Step)' 시리즈를 공개했다. 새 모델은 기존 대비 추론 단계를 90% 가까이 줄이면서도 이미지 생성과 이미지 기반 영상 생성 성능을 유지해, 오픈웨이트 모델 가운데 최고 수준의 성능을 기록했다.엔비디아는 최근 640억개(64B) 규모의 월드 파운데이션 모델(World Foundation Model) '코스모스3 슈퍼'를 기반으로 증류(Distillation)한 '코스모스3-슈퍼-텍스트2이미지-4스텝'과 '코스모스3-슈퍼-이
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안
