미니맥스가 가사와 음악 설명만 입력하면 최대 5분 길이의 스테레오 음원을 생성하는 오픈웨이트 텍스트-투-뮤직 모델 '뮤직3'를 17일 공개했다. 곡의 장기 구조를 담당하는 80억 매개변수 글로벌 LLM과 세부 음향을 담당하는 6억 매개변수 로컬 LLM을 결합한 '하이브리드-LLM' 구조를 사용하며, 최종 은닉 상태를 24억 매개변수 플로 매칭 모듈과 Flow-VAE로 이어 음원을 합성한다. 모델 가중치와 추론 코드는 물론 SGLang-Omni 서버, 디퓨저스, 컴파이UI 등 세 가지 배포 경로까지 함께 공개해 개발자가 자체 서버에서 즉시 서비스에 적용할 수 있게 했다. 커뮤니티 라이선스는 상업적 사용을 허용하지만 연매출 2000만달러를 넘으면 별도 승인이 필요하다.
- •80억 매개변수 글로벌 LLM과 0.6억 매개변수 로컬 LLM을 결합한 하이브리드-LLM 구조
- •32kHz·16비트 스테레오, 최대 5분 길이의 완성곡을 한 번에 생성
- •SGLang-Omni, 허깅페이스 디퓨저스, 컴파이UI 등 세 가지 자체 배포 경로 제공
- •상업적 사용 가능하나 연매출 2000만달러 초과 시 미니맥스의 서면 승인 필요
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
미니맥스, 5분 음악 생성 오픈웨이트 모델 '뮤직3' 공개…"즉시 서비스 적용 가능"
- 1.미니맥스, 오픈웨이트 텍스트-투-뮤직 모델 '뮤직3' 공개...최대 5분 길이 32kHz 스테레오 음원 생성
- 2.80억(글로벌LLM)+6억(로컬 LLM) 파라미터 하이브리드-LM 구조, 24억 규모 플로매칭 모듈로 음원 합성
- 3.모델 가중치·추론코드·배포 서버 모두 공개, 연매출 2000만달러 이하 상업적 이용 허용
왜 중요한가?
단순 루프 생성을 넘어 5분 완성곡을 자체 서버에서 직접 구동할 수 있게 오픈웨이트로 공개함으로써, API 비용 부담 없이 대량 음원을 생성해야 하는 개발자·기업에 실질적인 대안이 될 수 있다.
본문 미리보기
미니맥스가 가사와 음악 설명만 입력하면 최대 5분 길이의 완성된 음악을 한 번에 생성하는 오픈웨이트 모델을 공개했다. 특히 모델 가중치와 추론 코드, 서버 구축 방법까지 제공해 연구용 데모를 넘어 개발자와 기업이 즉시 실제 서비스에 적용할 수 있도록 한 것이 특징이다.미니맥스는 17일 텍스트-투-뮤직(text-to-music) 모델 ‘미니맥스-뮤직3(MiniMax-Music3)’를 공개했다.사용자는 가사와 음악에 대한 상세한 설명을 입력할 수 있으며, 모델은 이를 바탕으로 최대 5분 길이의 스테레오 WAV 음원을 생성한다. 출력 품
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
