미니맥스가 텍스트·이미지·영상·오디오를 하나의 모델에서 처리하는 멀티모달 영상 생성 모델 'H3'를 공개하고 하이루오 플랫폼과 API로 서비스를 시작했다. H3는 최대 15초 분량의 2K(1440p) 24fps 영상을 스테레오 오디오와 함께 네이티브로 생성하며, 아티피셜 애널리시스 벤치마크에서 영상 편집 1위, 텍스트-투-비디오 2위, 이미지-투-비디오 3위를 기록해 바이트댄스 시댄스와 경쟁할 수준으로 평가됐다. H3-VAE 토크나이저로 동일 연산량에 4배 긴 시퀀스를 처리해 초해상도 모델 없이 2K를 지원하고, 학습 처리량도 30% 개선했다. 생성 비용은 2K 초당 0.13달러로 경쟁 모델의 3분의 1 이하이며, 며칠 내 모델 가중치를 커뮤니티 라이선스로 공개(연매출 2000만달러 미만 기업 상업 이용 허용)하고 중국산 AI 반도체 지원까지 설계돼 폐쇄형 위주 영상 AI 시장의 판도 변수로 떠올랐다.
- •H3: 텍스트·이미지·영상·오디오 통합 입력으로 최대 15초 2K(1440p) 24fps 영상과 스테레오 사운드를 네이티브 생성
- •아티피셜 애널리시스 벤치마크 영상 편집 1위, T2V 2위, I2V 3위(시단스 2.5는 평가 미포함)
- •H3-VAE 토크나이저로 동일 연산량에 4배 긴 시퀀스 처리, 학습 처리량 30% 향상
- •2K 생성 비용 초당 0.13달러로 시단스·클링 3.0 등 경쟁 모델의 3분의 1 이하
- •며칠 내 오픈웨이트 공개 예정, 중국산 AI 반도체 지원 설계—연내 2조7000억 매개변수 LLM도 공개 계획
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
미니맥스, 텍스트·오디오 통합 멀티모달 영상 AI 'H3' 공개... "오픈웨이트로 시댄스에 도전"

본문 미리보기
미니맥스가 텍스트와 이미지, 영상, 오디오를 하나의 모델에서 처리하는 차세대 멀티모달 영상 생성 모델 'H3'를 공개했다. 이 모델은 아티피셜 애널리시스의 각종 벤치마크에서 최상위권을 기록, 바이트댄스의 '시댄스(Seedance)'와 경쟁할 만하다는 평가를 받았다.미니맥스는 31일 범용 멀티모달 생성 모델 H3를 공식 발표하고 '하이루오(Hailuo)' AI 플랫폼과 개발자 API를 통해 서비스를 시작했다.또 며칠 안에 H3의 모델 가중치를 미니맥스 커뮤니티 라이선스로 공개할 계획이다. 이를 통해 연 매출 2000만달러(약 29억원
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안
